O Google anunciou na quarta-feira, 26 de agosto de 2026, o Gemini 3.5 Transcribe, um modelo de inteligência artificial criado especificamente para transformar fala em texto. A novidade processa áudio ao vivo ou gravado, reconhece automaticamente mais de 85 idiomas, inclui português do Brasil e pode identificar quem falou cada trecho em uma gravação.
Para uma pequena ou média empresa, a aplicação vai além de gerar a ata de uma reunião. O modelo pode servir de base para registrar chamadas de atendimento, localizar objeções recorrentes, preparar o próximo contato comercial, alimentar um CRM e transformar entrevistas ou áudios em conteúdo.
Mas há uma distinção importante: o Gemini 3.5 Transcribe está em prévia pública e, para uso operacional, precisa ser conectado a um sistema pela API do Gemini, pela plataforma empresarial do Google ou por uma solução de terceiros. Não é um botão que passa a organizar sozinho todas as ligações da empresa.
O que o Gemini 3.5 Transcribe faz
O Google disponibilizou duas versões do modelo.
A versão ao vivo, chamada gemini-3.5-transcribe-live, recebe um fluxo contínuo de áudio e devolve a transcrição com latência inferior a um segundo. Ela foi pensada para experiências como agentes de voz, legendas em tempo real e apoio durante uma conversa.
A versão gemini-3.5-transcribe processa arquivos já gravados, como reuniões, entrevistas e registros de chamadas. Nesse modo, o sistema pode acrescentar marcações de tempo por palavra e atribuir os trechos a participantes diferentes.
Entre as funções confirmadas pelo Google estão:
- detecção automática de mais de 85 idiomas, inclusive mudanças de idioma durante a conversa;
- suporte específico a português do Brasil;
- identificação de até oito participantes em áudio gravado, com atribuição acima de três participantes ainda classificada como experimental;
- vocabulário personalizado com até mil termos, útil para nomes de produtos, marcas e expressões do setor;
- remoção de hesitações e palavras de preenchimento;
- formatação de códigos, números de pedidos e outros dados alfanuméricos;
- marcações de tempo no arquivo transcrito.
O anúncio do Google informa taxa média de erro por palavra de 4% para transcrição ao vivo e 2,6% para áudio gravado, com base em medição da Artificial Analysis. Em outro teste citado pela empresa, o tempo até a transcrição final caiu 70% em comparação com o modelo Chirp 3.
Os resultados indicam avanço técnico, mas não eliminam a necessidade de teste. Sotaque, ruído, sobreposição de vozes, qualidade do microfone e vocabulário próprio podem alterar a precisão em uma chamada real de vendas ou suporte.
Onde a novidade está disponível
O modelo já pode ser testado por desenvolvedores no Google AI Studio e pela API do Gemini. Empresas também podem acessá-lo em prévia pela Gemini Enterprise Agent Platform. O Google afirma que a integração com o Gemini Enterprise for Customer Experience chegará em breve.
Nos produtos de uso cotidiano, a distribuição é mais limitada. O Gemini 3.5 Transcribe está no aplicativo do Gemini para macOS em inglês e sustenta o Rambler no Gboard para Android em países e idiomas selecionados. A documentação do Rambler inclui português entre os idiomas compatíveis. A função de ditar texto em qualquer campo do Chrome foi anunciada para o futuro.
Essa diferença de disponibilidade importa para a PME brasileira. O suporte ao português existe no modelo, mas uma operação que queira transcrever chamadas, separar interlocutores e enviar dados ao CRM ainda precisa de implantação. A empresa deve avaliar se seu sistema de telefonia, atendimento ou reuniões oferecerá uma integração pronta antes de considerar desenvolvimento próprio.
Quanto pode custar transcrever chamadas
Na API do Gemini, o Google estima um preço combinado de aproximadamente US$ 0,009 por minuto para transcrição ao vivo e US$ 0,005 por minuto para arquivos gravados no nível pago. Os valores consideram a cobrança do áudio de entrada e do texto de saída e podem variar conforme o volume de tokens efetivamente processado.
Em uma simulação simples, 1.000 minutos de áudio gravado representariam cerca de US$ 5 apenas no uso do modelo. Esse número não inclui desenvolvimento, telefonia, armazenamento, revisão humana, integração com CRM nem o custo da plataforma que eventualmente ofereça a solução pronta.
O nível gratuito também permite testar o modelo, mas a página oficial de preços informa que os dados podem ser usados para melhorar os produtos do Google. No nível pago, a mesma tabela indica que os dados não são usados para esse fim.
Para uma empresa, portanto, o custo do áudio é apenas uma parte da decisão. Segurança, retenção, controle de acesso e manutenção do fluxo podem pesar mais do que a transcrição em si.
Quatro usos práticos para marketing e vendas
1. Registrar chamadas comerciais sem depender da memória
Uma conversa de 20 minutos costuma produzir informações que não cabem no campo de observação de um CRM: motivo da compra, urgência, faixa de orçamento, concorrente avaliado, restrição interna e próximo passo combinado.
Com transcrição e uma etapa posterior de análise, a empresa pode preparar um resumo padronizado, sugerir campos para o CRM e criar uma tarefa de retorno. O vendedor continua responsável por validar o registro, mas deixa de reconstruir a conversa horas depois.
2. Encontrar objeções recorrentes
Quando dezenas de chamadas ficam apenas na cabeça de pessoas diferentes, a empresa perde uma fonte valiosa de pesquisa de cliente. A transcrição permite agrupar trechos sobre preço, prazo, confiança, funcionalidades e comparação com concorrentes.
Esse material pode orientar páginas do site, anúncios, propostas e treinamento comercial. A vantagem não está em produzir um relatório sofisticado, mas em identificar padrões que antes apareciam como impressões isoladas.
3. Melhorar a passagem entre atendimento e vendas
Em muitas PMEs, o cliente repete a mesma história ao WhatsApp, ao telefone e ao vendedor. Uma transcrição bem resumida pode carregar contexto entre as etapas, desde que o acesso seja restrito a quem precisa dele.
O ganho é reduzir repetição e acelerar a resposta, não acumular gravações indefinidamente. O fluxo precisa definir quais trechos são úteis, quem pode consultá-los e quando serão apagados.
4. Reaproveitar entrevistas e áudios em conteúdo
Entrevistas com clientes, conversas com especialistas, webinars e notas de voz podem virar matéria-prima para artigos, perguntas frequentes, roteiros e posts. O vocabulário personalizado ajuda a reconhecer nomes de produtos e termos de nicho que uma transcrição genérica costuma errar.
Ainda assim, publicar exige edição. Remover hesitações melhora a leitura, mas também pode apagar nuances. Citações, números e afirmações sensíveis devem ser conferidos no áudio original antes de chegar ao público.
Os limites que precisam entrar no projeto
Na API do Gemini, a transcrição ao vivo aceita sessões de até dez minutos. Arquivos gravados podem chegar a uma hora, mas o limite cai para 30 minutos quando funções como identificação de participantes ou marcação por palavra são ativadas. Na plataforma empresarial do Google, a documentação de prévia traz limites próprios e menores. A arquitetura precisa considerar a divisão de chamadas longas.
A identificação de participantes também não deve ser tratada como identidade confirmada. Rótulos como “participante 1” e “participante 2” ajudam a separar vozes, mas a empresa precisa associá-los corretamente às pessoas e revisar conversas com interrupções ou fala simultânea.
Há ainda a questão da retenção. Na Interactions API, o armazenamento de interações vem ativado por padrão. A documentação informa retenção de um dia no nível gratuito e de até 55 dias no pago, com possibilidade de usar store=false quando o histórico no servidor não for necessário. Arquivos enviados pela File API precisam ser excluídos pelo responsável ou aguardam o prazo de expiração.
Antes de transcrever clientes ou funcionários, a PME deve definir finalidade, aviso adequado, base de tratamento, acesso, prazo de guarda e processo de exclusão conforme sua realidade e a LGPD. Gravar tudo porque ficou barato é uma prática de risco, não uma estratégia de dados.
Como testar sem criar uma automação difícil de controlar
O primeiro piloto não precisa começar em todas as ligações. Uma empresa pode escolher um tipo de conversa, como demonstração comercial, entrevista de diagnóstico ou reunião de briefing, e testar um volume pequeno com autorização e revisão.
Um roteiro simples inclui cinco etapas:
- selecionar uma conversa com objetivo e participantes definidos;
- transcrever o áudio e acrescentar um vocabulário curto com marcas, produtos e termos realmente necessários;
- comparar o texto com a gravação, sobretudo em preços, nomes, prazos e compromissos;
- transformar somente os campos úteis em resumo, tarefa ou sugestão para o CRM;
- medir tempo economizado, correções exigidas e impacto no próximo passo comercial.
O teste deve ter uma condição de parada. Se a equipe corrige nomes e números em quase todas as chamadas, ou se os resumos não mudam nenhuma ação, ampliar o volume apenas aumenta custo e exposição de dados.
Leitura da AgenciAR: transcrição só cria valor quando muda a próxima ação
O lançamento do Gemini 3.5 Transcribe reduz duas barreiras que impediam PMEs de trabalhar melhor com voz: custo de processamento e dificuldade para reconhecer português, sotaques e vocabulário específico. Isso abre espaço para ferramentas mais acessíveis de atendimento, pesquisa de cliente e acompanhamento comercial.
Mas texto acumulado não é inteligência comercial. Uma pasta com centenas de transcrições pode ser tão inútil quanto uma caixa de entrada desorganizada. O valor aparece quando a empresa sabe qual decisão deve sair de cada conversa: atualizar uma oportunidade, responder uma objeção, corrigir uma página, criar uma tarefa ou encerrar um caso.
Por isso, o melhor projeto não começa pela pergunta “quantas horas de áudio podemos transcrever?”. Começa por “qual informação hoje se perde entre a conversa e a próxima ação?”. Essa definição reduz escopo, exposição de dados e automações que parecem eficientes, mas não melhoram vendas nem atendimento.
O Gemini 3.5 Transcribe é uma infraestrutura promissora, não um processo pronto. Para a PME, a vantagem competitiva continuará na combinação entre uma captura confiável, revisão humana e disciplina para transformar fala em ação verificável.
Fontes consultadas
- Google: Intelligent transcription with Gemini 3.5 Transcribe, anúncio oficial de 26 de agosto de 2026 sobre recursos, desempenho, idiomas, formas de acesso e disponibilidade.
- Google AI for Developers: Gemini 3.5 Transcribe, documentação oficial sobre idiomas, limites, identificação de participantes, vocabulário personalizado e duração dos áudios.
- Google AI for Developers: Gemini Developer API pricing, preços oficiais, condições do nível gratuito e estimativas por minuto.
- Google AI for Developers: Interactions API, documentação oficial sobre armazenamento, retenção e uso de
store=false.
Perguntas frequentes
O Gemini 3.5 Transcribe entende português do Brasil?
Sim. A documentação oficial lista português do Brasil (pt-BR) entre os mais de 85 idiomas reconhecidos pelo modelo.
O recurso já transcreve chamadas automaticamente?
Não sozinho. O modelo está em prévia pública e precisa ser integrado a um sistema pela API do Gemini, pela plataforma empresarial do Google ou por uma ferramenta de terceiros.
Ele consegue separar as pessoas que falaram?
Em áudio gravado, sim. A documentação informa identificação de até oito participantes, mas a atribuição acima de três vozes ainda é experimental e deve ser revisada.
Quanto custa transcrever uma hora de áudio?
Pela estimativa do Google para a API paga, uma hora gravada custa cerca de US$ 0,30 somente no processamento do modelo. Desenvolvimento, armazenamento, telefonia, plataforma e revisão não estão incluídos.
Posso enviar gravações de clientes sem revisão de privacidade?
Não é recomendável. A empresa deve definir finalidade, aviso, acesso, retenção e exclusão de acordo com o caso e a LGPD, além de revisar as configurações de armazenamento da API escolhida.




