Transcrever áudio e vídeo em texto

Áudio do WhatsApp, reunião gravada, aula, entrevista ou vídeo viram texto e legenda, sem o arquivo sair do seu computador.

Entre na sua conta para curtir e guardar o que gostou.

Arraste um áudio ou vídeo aqui ou clique para escolher

OGG, Opus, MP3, M4A, MP4, MOV, MKV e mais 13 formatos. Nada é enviado, nem arquivo grande.

Seu áudio não é enviado para lugar nenhum: o modelo de reconhecimento de voz é baixado para o seu navegador e roda na sua máquina. Por isso a aba precisa ficar aberta até o fim. A transcrição é automática e pode errar nome próprio, sigla e termo técnico: revise antes de usar em documento.

Compartilhar

Ouça como funciona

Transcrever áudio e vídeo em texto

0:00 / 3:56
1×
O que está neste áudio: 5 seções

Tempos ancorados nas pausas do próprio áudio, com margem de alguns décimos.

Sincronia do destaque
no ponto
Se a voz parecer atrás do trecho marcado, atrase o destaque

O que esta ferramenta faz

Ela transforma fala em texto: você solta um arquivo de áudio ou de vídeo, escolhe o nível de qualidade e recebe a transcrição escrita, com pontuação e acentos, mais os arquivos de legenda SRT e VTT com o tempo de cada frase. Serve para áudio de WhatsApp, reunião gravada no Meet, no Zoom ou no Teams, aula, palestra, entrevista, podcast, sermão, depoimento, nota de voz do celular e vídeo do YouTube que você tenha baixado.

Tudo acontece dentro do seu navegador. O modelo de reconhecimento de voz é baixado uma vez para a sua máquina e roda nela, usando a placa de vídeo quando ela existe. O arquivo nunca é enviado para servidor nenhum, e isso muda três coisas na prática: não existe limite de duração ou de tamanho, não existe fila nem plano pago, e uma reunião confidencial continua confidencial.

Como funciona a transcrição no navegador

O motor é o Whisper, o modelo de reconhecimento de fala que a OpenAI publicou em 2022 com licença aberta (MIT), treinado com 680 mil horas de áudio em quase cem idiomas. Aqui ele roda numa versão convertida para o navegador pelo projeto Transformers.js, da Hugging Face, sobre o ONNX Runtime, que é o mesmo tipo de motor que executa modelos de IA em aplicativos de celular e de desktop.

O caminho de um arquivo até virar texto tem quatro etapas, todas na sua máquina:

  • Leitura do áudio: o navegador abre o arquivo por partes, sem carregá-lo inteiro na memória, e separa a faixa de áudio. Se for vídeo, a imagem é ignorada. O som é convertido para o formato que o modelo espera, 16 mil amostras por segundo em um canal só, que é o suficiente para voz.
  • Janelas de 30 segundos: o Whisper enxerga meio minuto de cada vez. O áudio é cortado em janelas de 30 segundos que se sobrepõem 5 segundos de cada lado, para nenhuma palavra ficar partida no corte.
  • Reconhecimento: cada janela vira um espectrograma (uma imagem do som ao longo do tempo) e o modelo o lê como quem lê uma frase, escrevendo palavra por palavra e marcando, junto, o instante em que cada trecho foi dito. Com placa de vídeo, essa conta roda na GPU via WebGPU; sem ela, roda no processador via WebAssembly.
  • Costura: as janelas são emendadas pelos carimbos de tempo. Onde duas janelas se sobrepõem, o texto repetido é reconciliado e fica uma versão só. O resultado é a lista de trechos com início, fim e texto, que alimenta o texto corrido, a visão com tempos e as legendas.

O processamento acontece num Worker, uma thread separada da página, por isso a tela continua respondendo enquanto o modelo trabalha: dá para rolar, ler o texto parcial que vai aparecendo e cancelar a qualquer momento. A memória fica estável do começo ao fim, porque só a janela atual fica carregada: uma reunião de três horas ocupa o mesmo que um áudio de dez segundos, só demora mais.

Na primeira vez, o modelo é baixado do Hugging Face, que hospeda os arquivos de graça, e guardado no cache do navegador. Da segunda vez em diante ele carrega da sua própria máquina em poucos segundos, mesmo sem internet. O download é o único tráfego de rede da ferramenta: dá para conferir na aba Rede do navegador que nenhuma requisição leva o seu arquivo.

Os níveis de qualidade, e por que a ferramenta escolhe por você

O Whisper existe em vários tamanhos, e tamanho aqui é literal: mais parâmetros, mais acerto, mais download e mais tempo. A ferramenta trabalha com três, mas não oferece os três a todo mundo: ela testa o que a sua máquina roda, marca o melhor como recomendado e mostra só a alternativa mais leve que ainda faz sentido ali. Com placa de vídeo, o nível Leve nem aparece, porque o Equilibrado já roda em segundos e erra a metade.

Medido em 17/09/2026 numa narração limpa de 3 minutos e 41 segundos, comparando com o texto original: o Leve errou 9,3% das palavras; o Equilibrado, 4,2%, e a maior parte disso foi formatação de número ("dez" virou "10"). Em áudio de sala, gravado longe do microfone, a distância entre os níveis cresce, e é aí que o Preciso se paga.

  • Preciso (whisper-large-v3-turbo, 809 milhões de parâmetros): 1,6 GB, só com placa de vídeo que suporte cálculo em meia precisão (a maioria das placas dedicadas e dos chips Apple M). É o mesmo modelo que serviços pagos usam por trás. Lida com sotaque, ruído de fundo, várias pessoas e termo técnico muito melhor que os outros dois. Onde roda, é o recomendado.
  • Equilibrado (whisper-small, 244 milhões): 586 MB com placa de vídeo, 249 MB sem. É o recomendado onde o Preciso não roda: pontuação boa, poucos erros em fala clara, aguenta alguma conversa cruzada.
  • Leve (whisper-base, 74 milhões): 77 MB, só sem placa de vídeo. Roda em qualquer aparelho, inclusive celular, e é a saída para máquina fraca ou conexão ruim. Acerta bem áudio limpo com uma pessoa falando perto do microfone; erra bastante em sotaque forte, ruído e nome próprio, e vale revisar tudo.
NívelModeloCom placa de vídeoSó processador
Levewhisper-base207 MB77 MB
Equilibradowhisper-small586 MB249 MB
Precisowhisper-large-v3-turbo1,6 GBsó com placa de vídeo

Regra prática: fique com o recomendado. Se o resultado vier com erro demais e houver um nível acima disponível, a própria tela oferece "Refazer" nele; se o aparelho travar ou o download for inviável, desça um. A ferramenta mostra, em cada nível, o tamanho do download e se ele já está no seu navegador.

Quanto tempo leva

Depende do nível e, principalmente, de ter ou não placa de vídeo acessível pelo navegador (WebGPU). Como referência aproximada (varia muito de aparelho para aparelho; a ferramenta mostra a velocidade real no fim de cada transcrição):

  • Notebook com placa dedicada ou Mac com chip M, no nível Equilibrado: uma hora de áudio em três a seis minutos, ou seja, 10 a 20 vezes mais rápido que o tempo real. No Preciso, oito a quinze minutos por hora de áudio.
  • Notebook com gráfico integrado (Intel Iris, AMD Radeon integrado), no Equilibrado: uma hora de áudio em dez a vinte minutos.
  • Sem WebGPU (processador só, via WebAssembly): duas a três vezes mais rápido que o tempo real no Leve e perto do tempo real no Equilibrado. Um áudio de dez minutos leva de quatro a doze minutos.

Somado a isso, na primeira vez, o download do modelo: alguns segundos numa fibra, alguns minutos num 4G para o Equilibrado, e o Preciso pede paciência ou Wi-Fi. A barra de progresso mostra a etapa (download, carga na memória, transcrição), a estimativa de tempo restante e o texto conforme vai sendo reconhecido.

O Chrome e o Edge expõem o WebGPU desde 2023; o Firefox e o Safari, desde 2025. Se a ferramenta avisar que está rodando no processador, abrir a mesma página no Chrome costuma ser a maneira mais rápida de ganhar a aceleração.

O que você recebe: texto, tempos, SRT e VTT

A mesma transcrição sai em quatro formatos, e você escolhe o que usar sem transcrever de novo:

  • Texto corrido: o conteúdo em parágrafos, quebrados nas pausas longas da fala. É o que vai para a ata da reunião, para o resumo da aula, para o post do blog ou para colar num assistente de IA e pedir um resumo.
  • Com tempos: uma linha por trecho, com o minuto e o segundo no início. Serve para achar um momento específico no áudio original e para citar com precisão ("aos 12:40 o cliente aprovou o orçamento").
  • Legenda SRT: o formato de legenda mais aceito do mundo, com número, intervalo de tempo e texto de cada fala. Sobe direto no YouTube, no Vimeo, no Instagram, no TikTok, no Premiere, no DaVinci Resolve, no CapCut e no VLC.
  • Legenda VTT: a versão do SRT para a web, usada pela tag de vídeo do HTML e por players como o do Bunny, o Video.js e o Plyr. Se a legenda vai para um site, é este.

Os tempos das legendas são os que o modelo marcou ao reconhecer a fala, com resolução de 20 milissegundos. Em fala rápida, vale abrir o SRT no editor de vídeo e ajustar a divisão das linhas: o modelo separa por frase, e uma frase longa pode passar dos dois segundos que uma legenda confortável costuma ter.

Formatos aceitos

Qualquer arquivo de áudio ou de vídeo que o navegador saiba decodificar: MP3, WAV, OGG e Opus (os áudios do WhatsApp e do Telegram), M4A e AAC (gravador do iPhone, notas de voz), FLAC, MP4, MOV, MKV, WebM, AVI, M4V, TS, MTS, M2TS, MPG, MPEG, OGV e 3GP. A lista completa, com a origem típica de cada formato, é a mesma do conversor de vídeo, que usa o mesmo leitor.

O que decide é o codec do áudio dentro do arquivo, não a extensão. Um MKV com áudio em Opus ou AAC abre; um AVI antigo com áudio em formato que o navegador não conhece não abre, e a ferramenta avisa qual foi o codec recusado. Nesses casos, o conversor de vídeo transforma o arquivo em MP4 ou MP3 em segundos e resolve.

Vídeo sem faixa de áudio é recusado logo na abertura, com aviso: não há o que transcrever. Arquivo com mais de uma faixa de áudio (filme com dublagem e original, por exemplo) usa a faixa principal.

Áudio

  • OGG
  • Opus
  • MP3
  • M4A
  • AAC
  • WAV
  • FLAC

Vídeo

  • MP4
  • MOV
  • MKV
  • WebM
  • AVI
  • M4V
  • TS
  • MTS
  • M2TS
  • MPG
  • MPEG
  • OGV
  • 3GP

Arquivo que o navegador não decodifica? O conversor de vídeo e áudio transforma em MP4 ou MP3 em segundos, também sem enviar nada.

Privacidade: por que o arquivo não sai do seu computador

A maioria das ferramentas de transcrição online funciona assim: você sobe o áudio, ele vai para um servidor, é processado lá e o texto volta. Isso tem dois custos. O primeiro é o dinheiro: transcrever custa processamento, e quem processa cobra, por minuto ou por plano. O segundo é o risco: o seu áudio passou a existir numa máquina que não é sua, sujeita à política de retenção, aos funcionários, às falhas e aos vazamentos de quem a opera.

Aqui o modelo vem até você, em vez de o áudio ir até o modelo. É a inversão que zera os dois custos. Nenhum byte do arquivo sai do navegador: a única coisa baixada é o próprio modelo, e a única coisa enviada é nada. Não há conta, não há histórico no servidor, não há como recuperarmos um áudio seu porque ele nunca esteve conosco.

Isso importa mais aqui do que em quase qualquer outra ferramenta, porque áudio é o material mais sensível que circula num negócio: reunião com cliente, consulta, sessão, entrevista de emprego, gravação de aula com aluno menor de idade, depoimento, negociação. Para quem responde pela LGPD, a diferença entre "processado localmente" e "enviado a um terceiro" é a diferença entre não precisar de contrato de operador e precisar.

O mesmo vale para o texto que sai: ele existe só na sua tela até você copiar ou baixar. Recarregar a página apaga tudo.

Como conseguir uma transcrição melhor

O modelo é bom, mas trabalha com o que ouve. O que mais muda o resultado, em ordem de impacto:

  • Escolha o idioma certo em vez de deixar detectar, quando souber. A detecção lê só os primeiros segundos: se o áudio começa com música ou silêncio, ela pode errar.
  • Suba de nível quando houver sotaque forte, várias pessoas, ruído de fundo ou termo técnico. A diferença entre o Equilibrado e o Preciso nesses casos é grande.
  • Áudio gravado perto da boca (headset, celular na mão, microfone de lapela) rende muito mais que o microfone da sala captando de longe. Se a gravação ainda vai acontecer, isso vale mais que qualquer configuração.
  • Corte o silêncio e a música do começo e do fim antes, se puder. Silêncio longo é onde o modelo mais inventa: ele tende a repetir uma frase ou a escrever o que não foi dito. A ferramenta já remove repetições óbvias, mas não adivinha o que era música.
  • Revise nome próprio, sigla, número e termo específico da sua área. São os erros mais prováveis, e os mais caros num documento.

Transcrição automática ou humana?

Uma transcrição automática, em português claro e gravação razoável, acerta entre 85% e 97% das palavras, conforme o nível escolhido e a qualidade do áudio. Um transcritor humano profissional chega a 99% e ainda marca quem falou, anota hesitações se for pedido e entende contexto que o modelo não tem. A diferença de custo é de ordens de grandeza: aqui é zero e instantâneo; o serviço humano custa por minuto de áudio e leva dias.

Para a maioria dos usos, a automática resolve com uma revisão rápida: ata, resumo de aula, rascunho de artigo, legenda de vídeo de redes sociais, busca de um trecho numa gravação longa. Onde a fidelidade é o produto (perícia, ata notarial, transcrição para processo, legenda de obra audiovisual), a automática é o ponto de partida que corta a maior parte do trabalho humano, não o substituto.

Um caminho que funciona bem: transcreva aqui, cole o texto num assistente de IA com o pedido de "corrigir só ortografia e pontuação, sem mudar o conteúdo", e revise nomes e números no final. Você fica com um texto limpo em minutos, e o áudio nunca saiu do seu computador.

Como se compara com outras opções

Existem quatro famílias de ferramenta para transformar áudio em texto, e cada uma faz sentido num caso:

  • Ditado do sistema (Google Docs, Word, teclado do celular): grátis, mas só transcreve o que você fala ao vivo no microfone, não um arquivo gravado. Muita gente dá play no áudio perto do microfone para contornar isso; o resultado é pior e sem pontuação.
  • Serviços online (Otter, Notta, Transkriptor, Turboscribe e similares): sobem o áudio para um servidor. Têm recursos que esta ferramenta não tem, como identificar quem fala e resumir, e cobram por isso: os planos grátis limitam a minutos por mês e a tamanho de arquivo, e os pagos ficam entre 8 e 20 dólares mensais.
  • APIs de transcrição (OpenAI, Google, xAI, AssemblyAI): para quem programa. Cobram por hora de áudio, de 10 centavos a 36 centavos de dólar, com qualidade excelente e recursos de diarização. Exigem chave, conta, cartão e código.
  • Programas instalados (Whisper no terminal, MacWhisper, Buzz, Whisper Desktop): mesma família de modelo que esta página, com a mesma privacidade. Precisam de instalação, e no caso do terminal, de Python e de linha de comando.

Esta ferramenta ocupa o espaço entre as duas últimas: a qualidade do Whisper e a privacidade do programa instalado, sem instalar nada e sem pagar nada. O que ela não faz, por enquanto, é separar quem fala, resumir e traduzir; para isso, o texto que sai daqui entra em qualquer assistente de IA.

Atalhos para o que você precisa

Cada uma destas páginas abre a ferramenta já configurada e explica o caso com mais detalhe:

Perguntas frequentes

Acompanhe a narraçãoo texto que a voz está lendo, destacado conforme ela avança
O que ela faz

Transcrição de áudio e vídeo do Golber ponto net.

Esta ferramenta transforma fala em texto: você solta um áudio ou um vídeo, escolhe o idioma e a qualidade, e recebe a transcrição escrita, com pontuação e acentos, mais a legenda em SRT e em VTT com o tempo de cada frase. Serve para áudio de WhatsApp, reunião gravada no Meet, no Zoom ou no Teams, aula, entrevista, podcast e vídeo que você baixou para estudar.

Como funciona

O motor é o Whisper, o modelo de reconhecimento de voz da OpenAI, em versão aberta. A diferença para os serviços de transcrição que você conhece é onde ele roda: aqui o modelo é baixado uma vez para o seu navegador e trabalha na sua própria máquina, usando a placa de vídeo quando ela existe. O arquivo nunca sai do seu computador. Você pode conferir sozinho, abrindo a aba Rede do navegador: as únicas requisições são as dos arquivos do modelo.

O áudio é lido em pedaços de trinta segundos, um de cada vez, e o texto vai aparecendo na tela enquanto o modelo trabalha. Por isso não existe limite de duração: uma reunião de três horas ocupa a mesma memória de um áudio de dez segundos, só demora mais. E, como o trabalho acontece na sua máquina, a aba precisa ficar aberta até o fim.

Os níveis de qualidade

A ferramenta testa o que a sua máquina roda e marca o melhor nível como recomendado. Com placa de vídeo, é o Preciso: o mesmo modelo que os serviços pagos usam por trás, com um download de um vírgula seis gigabytes na primeira vez. Sem placa de vídeo, é o Equilibrado, que acerta bem o português em fala clara. Ao lado do recomendado aparece uma alternativa mais leve, para aparelho fraco ou conexão ruim, e ela erra mais, principalmente em áudio gravado de longe. Na dúvida, fique com o recomendado. Se o resultado vier com erro demais, a própria tela oferece refazer no nível acima.

O download acontece só na primeira vez. Depois, o modelo fica guardado no navegador, e as próximas transcrições começam na hora, mesmo sem internet.

Idioma e resultado

O padrão é português, e vale manter quando você sabe o idioma do áudio: escolher acerta mais do que detectar. Se não souber, a opção de detectar automaticamente lê os primeiros segundos e decide. O modelo entende cerca de cem idiomas.

No fim, a mesma transcrição sai em três formatos. O texto corrido, em parágrafos, para a ata, o resumo ou para colar num assistente de inteligência artificial. A versão com tempos, com o minuto de cada frase, para achar um trecho na gravação e citar com precisão. E a legenda, em SRT e em VTT, pronta para o YouTube, o Instagram, o Premiere, o CapCut ou o player do seu site. Você copia com um clique ou baixa o arquivo.

Privacidade e limites

Sobre privacidade: como o áudio não é enviado, esta ferramenta serve para o material que ninguém deveria mandar para um site desconhecido. Reunião com cliente, consulta, entrevista, negociação. Nem nós temos acesso ao arquivo, porque ele nunca chega até nós. Para quem responde pela LGPD, é tratamento local, sem operador terceiro.

Dois cuidados. A transcrição é automática, e o ponto fraco é nome próprio, sigla, número e termo técnico: revise esses antes de usar em documento. E a qualidade da gravação manda mais do que qualquer ajuste: microfone perto da boca e uma pessoa falando por vez rendem muito mais do que o microfone da sala captando de longe.

A ferramenta funciona em versões atuais de Chrome, Edge, Firefox e Safari. A aceleração pela placa de vídeo existe no Chrome e no Edge há mais tempo; se a página avisar que está rodando no processador, abrir a mesma ferramenta no Chrome costuma ser a maneira mais rápida de ganhar velocidade.

Ferramentas para organizar o seu dia a dia

Depois da conta, tem finanças, escalas e listas de compras. E, se precisar de algo sob medida, dá pra falar comigo.