Todo mundo tem um contato que manda áudio de sete minutos para dizer o que caberia em duas linhas. Em reunião, no ônibus, com criança dormindo do lado, ouvir não é opção, e acelerar para 2x não resolve quando o assunto é importante. Ler resolve: texto dá para passar o olho, buscar um nome, copiar um endereço e guardar.
Esta página transcreve o áudio do WhatsApp inteiro, com pontuação e acentos, no seu próprio navegador. Você salva o arquivo (ele sai como .ogg ou .opus), solta aqui e o texto aparece. Serve para áudio recebido, enviado e encaminhado, do WhatsApp comum e do Business, e para o Telegram, que usa o mesmo formato.
Nada é enviado para lugar nenhum. O modelo de reconhecimento de voz roda na sua máquina, e é por isso que dá para usar com áudio de cliente, de médico, de advogado e de família sem pensar duas vezes: o arquivo não passa por servidor de terceiro, e nem por nós.
Por que o áudio do WhatsApp é .opus, e por que isso ajuda
O WhatsApp grava voz com o codec Opus, feito para fala em conexão ruim: um minuto de áudio cabe em uns 100 KB. O arquivo sai com extensão .ogg (o container) ou .opus (o codec), dependendo do sistema e do jeito que você salvou, e os dois abrem aqui do mesmo jeito. O que o Opus corta é o que a voz não usa, então o modelo de transcrição enxerga o áudio praticamente como se fosse o original. O único cuidado é no próprio celular: áudio gravado com o aparelho longe da boca, na rua ou dentro do carro, chega abafado, e aí o nível Equilibrado ou o Preciso fazem diferença.
Esta página abre a ferramenta já ajustada para o seu caso. A página principal da transcrição explica em detalhe como o reconhecimento de voz roda no navegador, o que muda entre os três níveis de qualidade, quanto tempo leva e o que fazer com o texto, os tempos e as legendas que saem daqui.