O Google anunciou na quarta-feira, 26 de agosto de 2026, o Gemini 3.5 Transcribe, um modelo de inteligência artificial criado especificamente para transformar fala em texto. A novidade processa áudio ao vivo ou gravado, reconhece automaticamente mais de 85 idiomas, inclui português do Brasil e pode identificar quem falou cada trecho em uma gravação.

Para uma pequena ou média empresa, a aplicação vai além de gerar a ata de uma reunião. O modelo pode servir de base para registrar chamadas de atendimento, localizar objeções recorrentes, preparar o próximo contato comercial, alimentar um CRM e transformar entrevistas ou áudios em conteúdo.

Mas há uma distinção importante: o Gemini 3.5 Transcribe está em prévia pública e, para uso operacional, precisa ser conectado a um sistema pela API do Gemini, pela plataforma empresarial do Google ou por uma solução de terceiros. Não é um botão que passa a organizar sozinho todas as ligações da empresa.

O que o Gemini 3.5 Transcribe faz

O Google disponibilizou duas versões do modelo.

A versão ao vivo, chamada gemini-3.5-transcribe-live, recebe um fluxo contínuo de áudio e devolve a transcrição com latência inferior a um segundo. Ela foi pensada para experiências como agentes de voz, legendas em tempo real e apoio durante uma conversa.

A versão gemini-3.5-transcribe processa arquivos já gravados, como reuniões, entrevistas e registros de chamadas. Nesse modo, o sistema pode acrescentar marcações de tempo por palavra e atribuir os trechos a participantes diferentes.

Entre as funções confirmadas pelo Google estão:

  • detecção automática de mais de 85 idiomas, inclusive mudanças de idioma durante a conversa;
  • suporte específico a português do Brasil;
  • identificação de até oito participantes em áudio gravado, com atribuição acima de três participantes ainda classificada como experimental;
  • vocabulário personalizado com até mil termos, útil para nomes de produtos, marcas e expressões do setor;
  • remoção de hesitações e palavras de preenchimento;
  • formatação de códigos, números de pedidos e outros dados alfanuméricos;
  • marcações de tempo no arquivo transcrito.

O anúncio do Google informa taxa média de erro por palavra de 4% para transcrição ao vivo e 2,6% para áudio gravado, com base em medição da Artificial Analysis. Em outro teste citado pela empresa, o tempo até a transcrição final caiu 70% em comparação com o modelo Chirp 3.

Os resultados indicam avanço técnico, mas não eliminam a necessidade de teste. Sotaque, ruído, sobreposição de vozes, qualidade do microfone e vocabulário próprio podem alterar a precisão em uma chamada real de vendas ou suporte.

Onde a novidade está disponível

O modelo já pode ser testado por desenvolvedores no Google AI Studio e pela API do Gemini. Empresas também podem acessá-lo em prévia pela Gemini Enterprise Agent Platform. O Google afirma que a integração com o Gemini Enterprise for Customer Experience chegará em breve.

Nos produtos de uso cotidiano, a distribuição é mais limitada. O Gemini 3.5 Transcribe está no aplicativo do Gemini para macOS em inglês e sustenta o Rambler no Gboard para Android em países e idiomas selecionados. A documentação do Rambler inclui português entre os idiomas compatíveis. A função de ditar texto em qualquer campo do Chrome foi anunciada para o futuro.

Essa diferença de disponibilidade importa para a PME brasileira. O suporte ao português existe no modelo, mas uma operação que queira transcrever chamadas, separar interlocutores e enviar dados ao CRM ainda precisa de implantação. A empresa deve avaliar se seu sistema de telefonia, atendimento ou reuniões oferecerá uma integração pronta antes de considerar desenvolvimento próprio.

Quanto pode custar transcrever chamadas

Na API do Gemini, o Google estima um preço combinado de aproximadamente US$ 0,009 por minuto para transcrição ao vivo e US$ 0,005 por minuto para arquivos gravados no nível pago. Os valores consideram a cobrança do áudio de entrada e do texto de saída e podem variar conforme o volume de tokens efetivamente processado.

Em uma simulação simples, 1.000 minutos de áudio gravado representariam cerca de US$ 5 apenas no uso do modelo. Esse número não inclui desenvolvimento, telefonia, armazenamento, revisão humana, integração com CRM nem o custo da plataforma que eventualmente ofereça a solução pronta.

O nível gratuito também permite testar o modelo, mas a página oficial de preços informa que os dados podem ser usados para melhorar os produtos do Google. No nível pago, a mesma tabela indica que os dados não são usados para esse fim.

Para uma empresa, portanto, o custo do áudio é apenas uma parte da decisão. Segurança, retenção, controle de acesso e manutenção do fluxo podem pesar mais do que a transcrição em si.

Quatro usos práticos para marketing e vendas

1. Registrar chamadas comerciais sem depender da memória

Uma conversa de 20 minutos costuma produzir informações que não cabem no campo de observação de um CRM: motivo da compra, urgência, faixa de orçamento, concorrente avaliado, restrição interna e próximo passo combinado.

Com transcrição e uma etapa posterior de análise, a empresa pode preparar um resumo padronizado, sugerir campos para o CRM e criar uma tarefa de retorno. O vendedor continua responsável por validar o registro, mas deixa de reconstruir a conversa horas depois.

2. Encontrar objeções recorrentes

Quando dezenas de chamadas ficam apenas na cabeça de pessoas diferentes, a empresa perde uma fonte valiosa de pesquisa de cliente. A transcrição permite agrupar trechos sobre preço, prazo, confiança, funcionalidades e comparação com concorrentes.

Esse material pode orientar páginas do site, anúncios, propostas e treinamento comercial. A vantagem não está em produzir um relatório sofisticado, mas em identificar padrões que antes apareciam como impressões isoladas.

3. Melhorar a passagem entre atendimento e vendas

Em muitas PMEs, o cliente repete a mesma história ao WhatsApp, ao telefone e ao vendedor. Uma transcrição bem resumida pode carregar contexto entre as etapas, desde que o acesso seja restrito a quem precisa dele.

O ganho é reduzir repetição e acelerar a resposta, não acumular gravações indefinidamente. O fluxo precisa definir quais trechos são úteis, quem pode consultá-los e quando serão apagados.

4. Reaproveitar entrevistas e áudios em conteúdo

Entrevistas com clientes, conversas com especialistas, webinars e notas de voz podem virar matéria-prima para artigos, perguntas frequentes, roteiros e posts. O vocabulário personalizado ajuda a reconhecer nomes de produtos e termos de nicho que uma transcrição genérica costuma errar.

Ainda assim, publicar exige edição. Remover hesitações melhora a leitura, mas também pode apagar nuances. Citações, números e afirmações sensíveis devem ser conferidos no áudio original antes de chegar ao público.

Os limites que precisam entrar no projeto

Na API do Gemini, a transcrição ao vivo aceita sessões de até dez minutos. Arquivos gravados podem chegar a uma hora, mas o limite cai para 30 minutos quando funções como identificação de participantes ou marcação por palavra são ativadas. Na plataforma empresarial do Google, a documentação de prévia traz limites próprios e menores. A arquitetura precisa considerar a divisão de chamadas longas.

A identificação de participantes também não deve ser tratada como identidade confirmada. Rótulos como “participante 1” e “participante 2” ajudam a separar vozes, mas a empresa precisa associá-los corretamente às pessoas e revisar conversas com interrupções ou fala simultânea.

Há ainda a questão da retenção. Na Interactions API, o armazenamento de interações vem ativado por padrão. A documentação informa retenção de um dia no nível gratuito e de até 55 dias no pago, com possibilidade de usar store=false quando o histórico no servidor não for necessário. Arquivos enviados pela File API precisam ser excluídos pelo responsável ou aguardam o prazo de expiração.

Antes de transcrever clientes ou funcionários, a PME deve definir finalidade, aviso adequado, base de tratamento, acesso, prazo de guarda e processo de exclusão conforme sua realidade e a LGPD. Gravar tudo porque ficou barato é uma prática de risco, não uma estratégia de dados.

Como testar sem criar uma automação difícil de controlar

O primeiro piloto não precisa começar em todas as ligações. Uma empresa pode escolher um tipo de conversa, como demonstração comercial, entrevista de diagnóstico ou reunião de briefing, e testar um volume pequeno com autorização e revisão.

Um roteiro simples inclui cinco etapas:

  1. selecionar uma conversa com objetivo e participantes definidos;
  2. transcrever o áudio e acrescentar um vocabulário curto com marcas, produtos e termos realmente necessários;
  3. comparar o texto com a gravação, sobretudo em preços, nomes, prazos e compromissos;
  4. transformar somente os campos úteis em resumo, tarefa ou sugestão para o CRM;
  5. medir tempo economizado, correções exigidas e impacto no próximo passo comercial.

O teste deve ter uma condição de parada. Se a equipe corrige nomes e números em quase todas as chamadas, ou se os resumos não mudam nenhuma ação, ampliar o volume apenas aumenta custo e exposição de dados.

Leitura da AgenciAR: transcrição só cria valor quando muda a próxima ação

O lançamento do Gemini 3.5 Transcribe reduz duas barreiras que impediam PMEs de trabalhar melhor com voz: custo de processamento e dificuldade para reconhecer português, sotaques e vocabulário específico. Isso abre espaço para ferramentas mais acessíveis de atendimento, pesquisa de cliente e acompanhamento comercial.

Mas texto acumulado não é inteligência comercial. Uma pasta com centenas de transcrições pode ser tão inútil quanto uma caixa de entrada desorganizada. O valor aparece quando a empresa sabe qual decisão deve sair de cada conversa: atualizar uma oportunidade, responder uma objeção, corrigir uma página, criar uma tarefa ou encerrar um caso.

Por isso, o melhor projeto não começa pela pergunta “quantas horas de áudio podemos transcrever?”. Começa por “qual informação hoje se perde entre a conversa e a próxima ação?”. Essa definição reduz escopo, exposição de dados e automações que parecem eficientes, mas não melhoram vendas nem atendimento.

O Gemini 3.5 Transcribe é uma infraestrutura promissora, não um processo pronto. Para a PME, a vantagem competitiva continuará na combinação entre uma captura confiável, revisão humana e disciplina para transformar fala em ação verificável.

Fontes consultadas

  • Google: Intelligent transcription with Gemini 3.5 Transcribe, anúncio oficial de 26 de agosto de 2026 sobre recursos, desempenho, idiomas, formas de acesso e disponibilidade.
  • Google AI for Developers: Gemini 3.5 Transcribe, documentação oficial sobre idiomas, limites, identificação de participantes, vocabulário personalizado e duração dos áudios.
  • Google AI for Developers: Gemini Developer API pricing, preços oficiais, condições do nível gratuito e estimativas por minuto.
  • Google AI for Developers: Interactions API, documentação oficial sobre armazenamento, retenção e uso de store=false.

Perguntas frequentes

O Gemini 3.5 Transcribe entende português do Brasil?

Sim. A documentação oficial lista português do Brasil (pt-BR) entre os mais de 85 idiomas reconhecidos pelo modelo.

O recurso já transcreve chamadas automaticamente?

Não sozinho. O modelo está em prévia pública e precisa ser integrado a um sistema pela API do Gemini, pela plataforma empresarial do Google ou por uma ferramenta de terceiros.

Ele consegue separar as pessoas que falaram?

Em áudio gravado, sim. A documentação informa identificação de até oito participantes, mas a atribuição acima de três vozes ainda é experimental e deve ser revisada.

Quanto custa transcrever uma hora de áudio?

Pela estimativa do Google para a API paga, uma hora gravada custa cerca de US$ 0,30 somente no processamento do modelo. Desenvolvimento, armazenamento, telefonia, plataforma e revisão não estão incluídos.

Posso enviar gravações de clientes sem revisão de privacidade?

Não é recomendável. A empresa deve definir finalidade, aviso, acesso, retenção e exclusão de acordo com o caso e a LGPD, além de revisar as configurações de armazenamento da API escolhida.