O que esta ferramenta faz
Ela transforma fala em texto: você solta um arquivo de áudio ou de vídeo, escolhe o nível de qualidade e recebe a transcrição escrita, com pontuação e acentos, mais os arquivos de legenda SRT e VTT com o tempo de cada frase. Serve para áudio de WhatsApp, reunião gravada no Meet, no Zoom ou no Teams, aula, palestra, entrevista, podcast, sermão, depoimento, nota de voz do celular e vídeo do YouTube que você tenha baixado.
Tudo acontece dentro do seu navegador. O modelo de reconhecimento de voz é baixado uma vez para a sua máquina e roda nela, usando a placa de vídeo quando ela existe. O arquivo nunca é enviado para servidor nenhum, e isso muda três coisas na prática: não existe limite de duração ou de tamanho, não existe fila nem plano pago, e uma reunião confidencial continua confidencial.
Como funciona a transcrição no navegador
O motor é o Whisper, o modelo de reconhecimento de fala que a OpenAI publicou em 2022 com licença aberta (MIT), treinado com 680 mil horas de áudio em quase cem idiomas. Aqui ele roda numa versão convertida para o navegador pelo projeto Transformers.js, da Hugging Face, sobre o ONNX Runtime, que é o mesmo tipo de motor que executa modelos de IA em aplicativos de celular e de desktop.
O caminho de um arquivo até virar texto tem quatro etapas, todas na sua máquina:
- Leitura do áudio: o navegador abre o arquivo por partes, sem carregá-lo inteiro na memória, e separa a faixa de áudio. Se for vídeo, a imagem é ignorada. O som é convertido para o formato que o modelo espera, 16 mil amostras por segundo em um canal só, que é o suficiente para voz.
- Janelas de 30 segundos: o Whisper enxerga meio minuto de cada vez. O áudio é cortado em janelas de 30 segundos que se sobrepõem 5 segundos de cada lado, para nenhuma palavra ficar partida no corte.
- Reconhecimento: cada janela vira um espectrograma (uma imagem do som ao longo do tempo) e o modelo o lê como quem lê uma frase, escrevendo palavra por palavra e marcando, junto, o instante em que cada trecho foi dito. Com placa de vídeo, essa conta roda na GPU via WebGPU; sem ela, roda no processador via WebAssembly.
- Costura: as janelas são emendadas pelos carimbos de tempo. Onde duas janelas se sobrepõem, o texto repetido é reconciliado e fica uma versão só. O resultado é a lista de trechos com início, fim e texto, que alimenta o texto corrido, a visão com tempos e as legendas.
O processamento acontece num Worker, uma thread separada da página, por isso a tela continua respondendo enquanto o modelo trabalha: dá para rolar, ler o texto parcial que vai aparecendo e cancelar a qualquer momento. A memória fica estável do começo ao fim, porque só a janela atual fica carregada: uma reunião de três horas ocupa o mesmo que um áudio de dez segundos, só demora mais.
Na primeira vez, o modelo é baixado do Hugging Face, que hospeda os arquivos de graça, e guardado no cache do navegador. Da segunda vez em diante ele carrega da sua própria máquina em poucos segundos, mesmo sem internet. O download é o único tráfego de rede da ferramenta: dá para conferir na aba Rede do navegador que nenhuma requisição leva o seu arquivo.
Os níveis de qualidade, e por que a ferramenta escolhe por você
O Whisper existe em vários tamanhos, e tamanho aqui é literal: mais parâmetros, mais acerto, mais download e mais tempo. A ferramenta trabalha com três, mas não oferece os três a todo mundo: ela testa o que a sua máquina roda, marca o melhor como recomendado e mostra só a alternativa mais leve que ainda faz sentido ali. Com placa de vídeo, o nível Leve nem aparece, porque o Equilibrado já roda em segundos e erra a metade.
Medido em 17/09/2026 numa narração limpa de 3 minutos e 41 segundos, comparando com o texto original: o Leve errou 9,3% das palavras; o Equilibrado, 4,2%, e a maior parte disso foi formatação de número ("dez" virou "10"). Em áudio de sala, gravado longe do microfone, a distância entre os níveis cresce, e é aí que o Preciso se paga.
- Preciso (whisper-large-v3-turbo, 809 milhões de parâmetros): 1,6 GB, só com placa de vídeo que suporte cálculo em meia precisão (a maioria das placas dedicadas e dos chips Apple M). É o mesmo modelo que serviços pagos usam por trás. Lida com sotaque, ruído de fundo, várias pessoas e termo técnico muito melhor que os outros dois. Onde roda, é o recomendado.
- Equilibrado (whisper-small, 244 milhões): 586 MB com placa de vídeo, 249 MB sem. É o recomendado onde o Preciso não roda: pontuação boa, poucos erros em fala clara, aguenta alguma conversa cruzada.
- Leve (whisper-base, 74 milhões): 77 MB, só sem placa de vídeo. Roda em qualquer aparelho, inclusive celular, e é a saída para máquina fraca ou conexão ruim. Acerta bem áudio limpo com uma pessoa falando perto do microfone; erra bastante em sotaque forte, ruído e nome próprio, e vale revisar tudo.
| Nível | Modelo | Com placa de vídeo | Só processador |
|---|---|---|---|
| Leve | whisper-base | 207 MB | 77 MB |
| Equilibrado | whisper-small | 586 MB | 249 MB |
| Preciso | whisper-large-v3-turbo | 1,6 GB | só com placa de vídeo |
Regra prática: fique com o recomendado. Se o resultado vier com erro demais e houver um nível acima disponível, a própria tela oferece "Refazer" nele; se o aparelho travar ou o download for inviável, desça um. A ferramenta mostra, em cada nível, o tamanho do download e se ele já está no seu navegador.
Quanto tempo leva
Depende do nível e, principalmente, de ter ou não placa de vídeo acessível pelo navegador (WebGPU). Como referência aproximada (varia muito de aparelho para aparelho; a ferramenta mostra a velocidade real no fim de cada transcrição):
- Notebook com placa dedicada ou Mac com chip M, no nível Equilibrado: uma hora de áudio em três a seis minutos, ou seja, 10 a 20 vezes mais rápido que o tempo real. No Preciso, oito a quinze minutos por hora de áudio.
- Notebook com gráfico integrado (Intel Iris, AMD Radeon integrado), no Equilibrado: uma hora de áudio em dez a vinte minutos.
- Sem WebGPU (processador só, via WebAssembly): duas a três vezes mais rápido que o tempo real no Leve e perto do tempo real no Equilibrado. Um áudio de dez minutos leva de quatro a doze minutos.
Somado a isso, na primeira vez, o download do modelo: alguns segundos numa fibra, alguns minutos num 4G para o Equilibrado, e o Preciso pede paciência ou Wi-Fi. A barra de progresso mostra a etapa (download, carga na memória, transcrição), a estimativa de tempo restante e o texto conforme vai sendo reconhecido.
O Chrome e o Edge expõem o WebGPU desde 2023; o Firefox e o Safari, desde 2025. Se a ferramenta avisar que está rodando no processador, abrir a mesma página no Chrome costuma ser a maneira mais rápida de ganhar a aceleração.
O que você recebe: texto, tempos, SRT e VTT
A mesma transcrição sai em quatro formatos, e você escolhe o que usar sem transcrever de novo:
- Texto corrido: o conteúdo em parágrafos, quebrados nas pausas longas da fala. É o que vai para a ata da reunião, para o resumo da aula, para o post do blog ou para colar num assistente de IA e pedir um resumo.
- Com tempos: uma linha por trecho, com o minuto e o segundo no início. Serve para achar um momento específico no áudio original e para citar com precisão ("aos 12:40 o cliente aprovou o orçamento").
- Legenda SRT: o formato de legenda mais aceito do mundo, com número, intervalo de tempo e texto de cada fala. Sobe direto no YouTube, no Vimeo, no Instagram, no TikTok, no Premiere, no DaVinci Resolve, no CapCut e no VLC.
- Legenda VTT: a versão do SRT para a web, usada pela tag de vídeo do HTML e por players como o do Bunny, o Video.js e o Plyr. Se a legenda vai para um site, é este.
Os tempos das legendas são os que o modelo marcou ao reconhecer a fala, com resolução de 20 milissegundos. Em fala rápida, vale abrir o SRT no editor de vídeo e ajustar a divisão das linhas: o modelo separa por frase, e uma frase longa pode passar dos dois segundos que uma legenda confortável costuma ter.
Formatos aceitos
Qualquer arquivo de áudio ou de vídeo que o navegador saiba decodificar: MP3, WAV, OGG e Opus (os áudios do WhatsApp e do Telegram), M4A e AAC (gravador do iPhone, notas de voz), FLAC, MP4, MOV, MKV, WebM, AVI, M4V, TS, MTS, M2TS, MPG, MPEG, OGV e 3GP. A lista completa, com a origem típica de cada formato, é a mesma do conversor de vídeo, que usa o mesmo leitor.
O que decide é o codec do áudio dentro do arquivo, não a extensão. Um MKV com áudio em Opus ou AAC abre; um AVI antigo com áudio em formato que o navegador não conhece não abre, e a ferramenta avisa qual foi o codec recusado. Nesses casos, o conversor de vídeo transforma o arquivo em MP4 ou MP3 em segundos e resolve.
Vídeo sem faixa de áudio é recusado logo na abertura, com aviso: não há o que transcrever. Arquivo com mais de uma faixa de áudio (filme com dublagem e original, por exemplo) usa a faixa principal.
Áudio
- OGG
- Opus
- MP3
- M4A
- AAC
- WAV
- FLAC
Vídeo
- MP4
- MOV
- MKV
- WebM
- AVI
- M4V
- TS
- MTS
- M2TS
- MPG
- MPEG
- OGV
- 3GP
Arquivo que o navegador não decodifica? O conversor de vídeo e áudio transforma em MP4 ou MP3 em segundos, também sem enviar nada.
Privacidade: por que o arquivo não sai do seu computador
A maioria das ferramentas de transcrição online funciona assim: você sobe o áudio, ele vai para um servidor, é processado lá e o texto volta. Isso tem dois custos. O primeiro é o dinheiro: transcrever custa processamento, e quem processa cobra, por minuto ou por plano. O segundo é o risco: o seu áudio passou a existir numa máquina que não é sua, sujeita à política de retenção, aos funcionários, às falhas e aos vazamentos de quem a opera.
Aqui o modelo vem até você, em vez de o áudio ir até o modelo. É a inversão que zera os dois custos. Nenhum byte do arquivo sai do navegador: a única coisa baixada é o próprio modelo, e a única coisa enviada é nada. Não há conta, não há histórico no servidor, não há como recuperarmos um áudio seu porque ele nunca esteve conosco.
Isso importa mais aqui do que em quase qualquer outra ferramenta, porque áudio é o material mais sensível que circula num negócio: reunião com cliente, consulta, sessão, entrevista de emprego, gravação de aula com aluno menor de idade, depoimento, negociação. Para quem responde pela LGPD, a diferença entre "processado localmente" e "enviado a um terceiro" é a diferença entre não precisar de contrato de operador e precisar.
O mesmo vale para o texto que sai: ele existe só na sua tela até você copiar ou baixar. Recarregar a página apaga tudo.
Como conseguir uma transcrição melhor
O modelo é bom, mas trabalha com o que ouve. O que mais muda o resultado, em ordem de impacto:
- Escolha o idioma certo em vez de deixar detectar, quando souber. A detecção lê só os primeiros segundos: se o áudio começa com música ou silêncio, ela pode errar.
- Suba de nível quando houver sotaque forte, várias pessoas, ruído de fundo ou termo técnico. A diferença entre o Equilibrado e o Preciso nesses casos é grande.
- Áudio gravado perto da boca (headset, celular na mão, microfone de lapela) rende muito mais que o microfone da sala captando de longe. Se a gravação ainda vai acontecer, isso vale mais que qualquer configuração.
- Corte o silêncio e a música do começo e do fim antes, se puder. Silêncio longo é onde o modelo mais inventa: ele tende a repetir uma frase ou a escrever o que não foi dito. A ferramenta já remove repetições óbvias, mas não adivinha o que era música.
- Revise nome próprio, sigla, número e termo específico da sua área. São os erros mais prováveis, e os mais caros num documento.
Transcrição automática ou humana?
Uma transcrição automática, em português claro e gravação razoável, acerta entre 85% e 97% das palavras, conforme o nível escolhido e a qualidade do áudio. Um transcritor humano profissional chega a 99% e ainda marca quem falou, anota hesitações se for pedido e entende contexto que o modelo não tem. A diferença de custo é de ordens de grandeza: aqui é zero e instantâneo; o serviço humano custa por minuto de áudio e leva dias.
Para a maioria dos usos, a automática resolve com uma revisão rápida: ata, resumo de aula, rascunho de artigo, legenda de vídeo de redes sociais, busca de um trecho numa gravação longa. Onde a fidelidade é o produto (perícia, ata notarial, transcrição para processo, legenda de obra audiovisual), a automática é o ponto de partida que corta a maior parte do trabalho humano, não o substituto.
Um caminho que funciona bem: transcreva aqui, cole o texto num assistente de IA com o pedido de "corrigir só ortografia e pontuação, sem mudar o conteúdo", e revise nomes e números no final. Você fica com um texto limpo em minutos, e o áudio nunca saiu do seu computador.
Como se compara com outras opções
Existem quatro famílias de ferramenta para transformar áudio em texto, e cada uma faz sentido num caso:
- Ditado do sistema (Google Docs, Word, teclado do celular): grátis, mas só transcreve o que você fala ao vivo no microfone, não um arquivo gravado. Muita gente dá play no áudio perto do microfone para contornar isso; o resultado é pior e sem pontuação.
- Serviços online (Otter, Notta, Transkriptor, Turboscribe e similares): sobem o áudio para um servidor. Têm recursos que esta ferramenta não tem, como identificar quem fala e resumir, e cobram por isso: os planos grátis limitam a minutos por mês e a tamanho de arquivo, e os pagos ficam entre 8 e 20 dólares mensais.
- APIs de transcrição (OpenAI, Google, xAI, AssemblyAI): para quem programa. Cobram por hora de áudio, de 10 centavos a 36 centavos de dólar, com qualidade excelente e recursos de diarização. Exigem chave, conta, cartão e código.
- Programas instalados (Whisper no terminal, MacWhisper, Buzz, Whisper Desktop): mesma família de modelo que esta página, com a mesma privacidade. Precisam de instalação, e no caso do terminal, de Python e de linha de comando.
Esta ferramenta ocupa o espaço entre as duas últimas: a qualidade do Whisper e a privacidade do programa instalado, sem instalar nada e sem pagar nada. O que ela não faz, por enquanto, é separar quem fala, resumir e traduzir; para isso, o texto que sai daqui entra em qualquer assistente de IA.
Atalhos para o que você precisa
Cada uma destas páginas abre a ferramenta já configurada e explica o caso com mais detalhe:
- Transcrever áudio do WhatsApp: Aquele áudio de sete minutos vira texto em segundos, sem sair do seu celular ou computador.
- Converter áudio em texto: MP3, M4A, WAV e nota de voz viram texto com pontuação, no seu navegador.
- Transcrever vídeo em texto: Aula, palestra, tutorial ou vídeo baixado do YouTube viram texto e legenda, no navegador.
- Gerar legenda SRT automaticamente: Legenda com tempo de cada fala, pronta para YouTube, Instagram, Premiere e CapCut, gerada no navegador.
- Transcrever reunião gravada: Gravação do Meet, do Zoom ou do Teams vira texto para a ata, sem sair do seu computador.