Legenda deixou de ser acessório: a maior parte dos vídeos em rede social é assistida sem som, o YouTube indexa o que está escrito, e acessibilidade é lei para quem publica conteúdo institucional. Escrever legenda na mão, marcando o tempo de cada frase, é um trabalho de três a quatro vezes a duração do vídeo. O modelo de reconhecimento de voz faz isso em minutos.
Esta página gera o arquivo SRT (e o VTT) do seu vídeo ou áudio no navegador. Cada fala sai com o instante de início e de fim, no formato que os editores e as plataformas leem. Você baixa o arquivo e sobe junto com o vídeo, ou importa no editor para ajustar antes de exportar.
O vídeo não é enviado: a ferramenta lê só o áudio, na sua máquina. Nada de marca d'água, de limite de minutos ou de plano. Por padrão ela abre no nível Preciso, porque legenda pede o melhor acerto possível; se a sua máquina não tiver placa de vídeo, o Equilibrado assume e o resultado continua bom para revisar.
SRT ou VTT, e o que fazer com o arquivo depois
SRT é o formato universal: número da legenda, intervalo de tempo com vírgula nos milissegundos (00:01:02,500) e o texto. VTT é o mesmo conteúdo com cabeçalho WEBVTT e ponto nos milissegundos, feito para o player de vídeo do navegador. No YouTube, vá em Legendas e envie o SRT; no Instagram e no TikTok, use o SRT no editor (CapCut importa direto); no Premiere, no DaVinci Resolve e no Final Cut, importe como legenda e ajuste as quebras de linha, porque o modelo separa por frase, e uma frase longa pode passar dos dois segundos e das duas linhas que uma legenda confortável costuma ter. Para vídeo no seu site, o VTT entra na tag track do HTML ou no painel do Bunny.
Esta página abre a ferramenta já ajustada para o seu caso. A página principal da transcrição explica em detalhe como o reconhecimento de voz roda no navegador, o que muda entre os três níveis de qualidade, quanto tempo leva e o que fazer com o texto, os tempos e as legendas que saem daqui.