
Gemini 3.5 Transcribe: O Que É, Quanto Custa e Como Usar o Novo Modelo de Áudio do Google
Gemini 3.5 Transcribe: O Que É, Quanto Custa e Como Usar o Novo Modelo de Áudio do Google
Gemini 3.5 Transcribe: O Que É, Quanto Custa e Como Usar o Novo Modelo de Áudio do Google
O Google lançou o Gemini 3.5 Transcribe e essa é uma daquelas novidades que parecem técnicas demais, mas resolvem um problema bem comum: transformar áudio em texto bom o suficiente para usar sem revisar linha por linha. Explico de forma simples o que muda (limpeza de vícios de linguagem, separação de até três falantes, marcação por palavra e vocabulário próprio com mil termos), quanto custa de verdade e como testar hoje sem escrever uma linha de código. E mostro onde isso encaixa no dia a dia de quem tem negócio no Brasil, do áudio de WhatsApp virando tarefa à passagem de plantão registrada, incluindo o que já roda no meu site pelo caminho inverso, transformando texto em voz.
Chegou um email do time do Google AI Studio anunciando o Gemini 3.5 Transcribe, e essa é daquelas novidades que parecem técnicas demais para importar, mas que na prática resolvem um problema bem comum: transformar áudio em texto bom o suficiente para usar sem revisar linha por linha.
Se você já tentou transcrever uma reunião, um áudio de WhatsApp de três minutos ou uma ligação de cliente, sabe o tamanho do problema. O que existia até agora entregava um texto cheio de "éé", "tipo assim", sem pontuação, sem separar quem falou o quê, e com o nome do seu produto escrito errado. Vou explicar de forma simples o que mudou, quanto custa (é bem barato), como testar hoje sem escrever código, e onde isso encaixa no dia a dia de quem tem um negócio.
-
Dois modelos: um para tempo real, com resposta em menos de um segundo, e outro para áudio já gravado, que aceita arquivos de até 1 hora numa tacada.
-
Ele separa quem falou: identifica até 3 pessoas diferentes na mesma gravação e marca o tempo palavra por palavra.
-
Modo inteligente: tira vícios de linguagem, resolve quando a pessoa se corrige no meio da frase e formata listas, datas e números do jeito certo.
-
Vocabulário próprio: você entrega uma lista de até 1.000 termos (nomes de produto, siglas, jargão do seu setor) e ele para de escrever errado.
-
85 idiomas e sotaques, com detecção automática. Português do Brasil incluído, com nossos regionalismos.
-
O preço é o mais surpreendente: cerca de US$ 0,005 por minuto de áudio gravado. Uma hora de reunião custa aproximadamente US$ 0,30, e dá para testar de graça no AI Studio.
O que é o Gemini 3.5 Transcribe, em português claro
É um modelo de inteligência artificial especializado em ouvir áudio e escrever o que foi dito. Só isso, e é justamente aí que está a graça: por ser especializado, ele acerta em situações onde os modelos genéricos patinam, como sala barulhenta, sotaque forte, duas pessoas falando e vocabulário técnico.
A diferença mais fácil de sentir é a qualidade do texto que sai. Não é a transcrição literal e crua que você precisa limpar depois; é um texto já pronto para ser usado, seja para virar uma ata, um resumo, um post ou a entrada de outra automação.
A transcrição parou de ser um rascunho que dá trabalho e virou um insumo pronto. É essa a virada, e é ela que abre uso comercial de verdade.
Os dois modelos, e quando usar cada um
|
Gemini 3.5 Transcribe: as duas versões |
||
|---|---|---|
|
Característica |
Tempo real |
Áudio gravado |
|
Nome do modelo |
gemini-3.5-transcribe-live |
gemini-3.5-transcribe |
|
Como funciona |
Streaming contínuo nos dois sentidos, com menos de 1 segundo de atraso |
Envia o arquivo e recebe o texto completo |
|
Limite |
Conversa ao vivo |
Até 1 hora de áudio por requisição |
|
Extras |
Ideal para agente de voz e legenda ao vivo |
Separa até 3 falantes e marca o tempo de cada palavra |
|
Custo aproximado |
US$ 0,009 por minuto |
US$ 0,005 por minuto |
|
Use quando |
A pessoa está falando agora e precisa de resposta |
O áudio já existe e você quer o texto organizado |
Os quatro recursos que fazem a diferença
1. Modo inteligente, que limpa o texto sozinho
Ele remove os "éé" e "ahn", entende quando a pessoa fala "quinze, não, desculpa, dezesseis reais" e escreve só o valor correto, e formata listas, datas e números do jeito que se escreve. O resultado é um texto que já pode ir direto para outra ferramenta de IA sem passar por limpeza.
2. Separação de quem falou, com marcação de tempo
Numa gravação com até três pessoas, ele identifica cada uma. E marca o tempo palavra por palavra, o que permite clicar num trecho do texto e pular exatamente para aquele ponto do áudio. Para ata de reunião e para cortar vídeo, isso economiza horas.
3. Vocabulário customizado
Este é o recurso que mais gente vai subestimar e mais resolve na prática. Você entrega uma lista com até 1.000 termos do seu mundo: nomes de produto, siglas do setor, nomes de clientes, palavras técnicas. A partir daí ele para de transcrever errado. Quem trabalha com saúde, direito, engenharia ou qualquer área cheia de jargão sabe o quanto isso muda o resultado.
4. Oitenta e cinco idiomas, com detecção automática
Ele identifica o idioma sozinho e lida com sotaques regionais. Para quem atende cliente do Brasil inteiro, isso significa transcrever o gaúcho, o pernambucano e o mineiro sem configurar nada.
Quanto custa de verdade
Aqui está a parte que muda a decisão. Com o áudio gravado custando cerca de US$ 0,005 por minuto:
-
Uma reunião de 1 hora: aproximadamente US$ 0,30, algo em torno de R$ 1,60 considerando o dólar a R$ 5,40.
-
Cem ligações de 5 minutos: cerca de US$ 2,50, menos de R$ 15 pelo mês inteiro de uma operação pequena de atendimento.
-
Um vídeo de 20 minutos para virar post e legenda: menos de US$ 0,10.
E dá para testar sem pagar nada: os dois modelos estão disponíveis em prévia pública no Google AI Studio, com camada gratuita para experimentação. Se você quer o panorama de quanto custa cada assinatura de IA e o que compensa pagar hoje, eu comparei tudo em vale a pena pagar por IA em 2026.
Como testar hoje, com ou sem código
Sem programar nada
Entre no Google AI Studio, escolha o modelo de transcrição, envie um arquivo de áudio e veja o resultado. Leva menos tempo que ler este post. É o caminho que eu recomendo para quem quer só entender se a qualidade serve para o seu caso antes de envolver alguém técnico.
Com código, para automatizar
O exemplo oficial em Python, comentado em português, para você entender o que cada parte faz:
from google import genaiclient = genai.Client()# 1. Envia o arquivo de áudio pela API de arquivosaudio_file = client.files.upload(file="caminho/para/audio.wav")# 2. Pede a transcrição com separação de falantes e marcação por palavrainteraction = client.interactions.create( model="gemini-3.5-transcribe", input=[{ "type": "audio", "uri": audio_file.uri, "mime_type": audio_file.mime_type, }], generation_config={ "transcription_config": { # Para português do Brasil, troque por ["pt-BR"] "language_codes": ["en-US"], # Os termos do SEU negócio, que ele não pode escrever errado "custom_vocabulary": ["Gemini", "Transcribe"], "mode": { "type": "verbatim", "diarization_mode": "speaker", # separa quem falou "timestamp_granularities": ["word"], # marca o tempo por palavra } } })print(interaction.output_text)
Existem SDKs para Python, JavaScript e Go, e dá para chamar direto por REST com cURL. Ou seja, encaixa em qualquer stack, inclusive dentro de uma automação sem código como o N8N, caminho que eu descrevi em como aprender N8N com IA.
Sete usos práticos para quem tem negócio no Brasil
-
Áudio de WhatsApp virando texto e tarefa. O cliente manda três minutos de áudio explicando o que quer. Em vez de ouvir duas vezes, você recebe o texto limpo, com o pedido separado do resto da conversa.
-
Reunião virando escopo de projeto. Grave a conversa, transcreva com separação de falantes e transforme em ata com decisões e responsáveis. É o começo de toda proposta bem feita, assunto que eu abri em a proposta digital que vende sozinha.
-
Análise pós-atendimento. Transcreva as ligações do mês e descubra as cinco objeções mais repetidas. É pesquisa de mercado grátis, saída direto da boca do seu cliente.
-
Legenda e reaproveitamento de vídeo. Com a marcação por palavra, cortar trechos para Reels e Shorts deixa de ser trabalho manual. Combina com o que escrevi em começar no YouTube em 2026.
-
Aula, palestra e treinamento viram material escrito. Uma hora de gravação vira apostila, resumo e roteiro de post, por menos de dois reais.
-
Acessibilidade de verdade. Legenda ao vivo em transmissão e em atendimento, com menos de um segundo de atraso, para quem tem perda auditiva.
-
Passagem de serviço registrada. Em operação com plantão, o relato falado na troca de turno vira registro escrito, com hora marcada, sem ninguém digitar nada.
Como isso conversa com o que eu já faço no golber.net
Esse anúncio me interessou por um motivo específico: eu já opero o caminho inverso há meses. Os posts do meu blog têm narração em áudio gerada por IA, com três provedores diferentes (Gemini, OpenAI e Grok), fatiando o texto em blocos, montando e publicando o MP3. Ou seja: texto virando voz. O Transcribe fecha o círculo, trazendo voz de volta para texto com qualidade de publicação.
Onde isso encaixa nos meus produtos e no que eu construo para cliente:
-
Nas escalas de trabalho. No sistema de escala, o ponto mais informal de qualquer operação de plantão é a passagem de serviço, que costuma acontecer falando. Transcrição transforma isso em registro pesquisável, junto do plantão, da viatura e do equipamento daquele dia.
-
Na lista de compras. Ditar "acabou o café e o detergente" enquanto se cozinha é mais natural que digitar. A lista de compras é o tipo de tela onde voz ganha do teclado com folga.
-
No atendimento do site. O chat que responde no golber.net pode receber áudio e continuar a conversa em texto, o que derruba a barreira de quem não gosta de escrever. Sobre juntar site, atendimento e vendas com IA sem quebrar a cara, escrevi o passo a passo aqui.
-
Nos projetos de cliente. Clínica que grava orientação, escritório que registra reunião, loja que recebe pedido por áudio: são três pedidos que já apareceram nas minhas conversas comerciais, e agora têm resposta barata.
Os cuidados que ninguém coloca no anúncio
-
Gravar conversa exige transparência. Avise que a chamada está sendo gravada e transcrita, e registre esse aviso. Não é só boa prática: é o que sustenta o uso do material depois.
-
LGPD vale para áudio. Voz de cliente é dado pessoal, e o conteúdo pode conter dado sensível (saúde, financeiro). Trate a transcrição com o mesmo cuidado do banco de dados: acesso restrito, prazo de retenção e finalidade declarada.
-
Revisão humana no que é crítico. Transcrição boa não é transcrição perfeita. Contrato, laudo e valor combinado pedem conferência de gente.
-
Voz também é vetor de golpe. A mesma tecnologia que entende áudio convive com a que imita voz. Vale conhecer o cenário em golpe da voz clonada por IA no Pix e em como identificar conteúdo gerado por IA.
Por onde começar, em três passos
-
Escolha um áudio real seu que hoje dá trabalho: uma reunião gravada, cinco áudios de cliente ou um vídeo antigo.
-
Teste no AI Studio com o modo inteligente ligado e com a sua lista de termos. Compare com o que você usava antes e veja se a qualidade resolve.
-
Automatize só o que se repetir toda semana. Transcrição avulsa não precisa de sistema; o que precisa é o fluxo recorrente, do tipo "todo áudio que chega no WhatsApp vira tarefa".
Se você quer esse tipo de automação rodando dentro do seu site ou do seu atendimento, com dado ficando na sua casa e não em plataforma alugada, me chame para conversar sobre o projeto. É exatamente o tipo de peça que eu monto.
Perguntas frequentes
O que é o Gemini 3.5 Transcribe?
É o modelo de transcrição de áudio do Google, lançado para converter fala em texto já formatado e revisado. Vem em duas versões: uma para tempo real, com menos de um segundo de atraso, e outra para arquivos gravados de até uma hora, com separação de até três falantes e marcação de tempo por palavra.
Ele funciona bem em português do Brasil?
Funciona. São mais de 85 idiomas e dialetos, com detecção automática e tratamento de sotaques regionais, o que inclui o português brasileiro e as variações de pronúncia entre regiões.
Quanto custa transcrever uma hora de áudio?
Cerca de US$ 0,30 no modelo de áudio gravado, considerando aproximadamente US$ 0,005 por minuto. A versão em tempo real custa por volta de US$ 0,009 por minuto. Há camada gratuita para teste no Google AI Studio.
Preciso saber programar para usar?
Para testar, não: o Google AI Studio permite enviar um arquivo e ver o resultado direto no navegador. Para automatizar dentro do seu sistema, aí sim entra código, com SDKs em Python, JavaScript e Go, ou chamada REST.
Ele separa quem falou na gravação?
Separa, até três pessoas por gravação, no modelo de áudio pré-gravado. Junto vem a marcação de tempo palavra por palavra, que permite pular direto para o trecho do áudio correspondente a qualquer parte do texto.
Posso transcrever ligações de clientes?
Pode, desde que informe que a chamada está sendo gravada e trate o conteúdo conforme a LGPD, já que voz é dado pessoal e a conversa pode conter dado sensível. Defina finalidade, prazo de retenção e quem tem acesso antes de começar.
Qual a diferença entre esse modelo e usar o ChatGPT ou o Gemini comum para transcrever?
O modelo especializado foi treinado para a tarefa e entrega recursos que o uso genérico não tem: separação de falantes, marcação por palavra, vocabulário customizado com até mil termos e limpeza automática de vícios de linguagem. Em áudio difícil, com ruído ou jargão, a diferença de qualidade é grande.
Quer mais conteúdo desse?
Receba toda semana o que escrevo sobre stack, IA aplicada e negócios solo. Zero spam, descadastro num clique.