O Google lançou o Gemini 3.5 Transcribe na terça-feira. O modelo de fala para texto remove palavras de preenchimento, respeita vocabulários fornecidos pelo usuário e identifica até três interlocutores em uma única gravação. Ao transformar áudio bruto em texto polido e estruturado sem a necessidade de um editor humano, o serviço reduz o tempo que os desenvolvedores gastam limpando transcrições para notas de reuniões, processos judiciais e muito mais.

Por que o Google decidiu agir agora

A pilha de processamento de áudio do Google vem evoluindo há anos, mas sua oferta anterior, o Chirp 3, ainda tropeçava em pausas, termos técnicos e trocas de interlocutores. O trabalho remoto e o podcasting inflaram o mercado de transcrição, mas muitas empresas ainda dependem de pós-processamento manual ou de fornecedores especializados caros. O Gemini 3.5 Transcribe responde a esse ponto de fricção: um modelo que não apenas reconhece a fala, mas também a edita em tempo real.

O que o novo modelo realmente faz

  • Remoção automática de palavras de preenchimento – “um”, “uh” e disfluências semelhantes desaparecem conforme a transcrição é gerada, resultando em uma leitura mais limpa.
  • Vocabulários personalizados – Os usuários fazem o upload de uma lista de palavras específicas de um domínio, evitando que o modelo as “corrija” para termos genéricos. Isso é importante para áreas repletas de siglas, nomes de produtos ou grafias estrangeiras.
  • Atribuição de interlocutor – O sistema identifica até três vozes distintas, atribui um rótulo de interlocutor a cada fala e adiciona uma marcação de tempo em nível de palavra. Equipes jurídicas, escribas médicos e jornalistas podem produzir registros com marcação de tempo diretamente do arquivo de origem.
  • Alcance multilíngue – O Google afirma ter melhorado a precisão em mais de 85 idiomas, um avanço em relação ao conjunto mais limitado de seu antecessor.

Todas essas funcionalidades estão integradas a uma API voltada para desenvolvedores. Os aplicativos solicitam uma transcrição e recebem um payload JSON que já contém o texto limpo, as etiquetas de interlocutor e as marcações de tempo.

O lançamento mais amplo de áudio do Gemini

O Gemini 3.5 Transcribe pertence a uma família mais ampla de modelos de áudio:

  • Gemini 3.5 Live – Otimizado para interação em tempo real, ele lida melhor com interrupções no meio de frases do que os modelos ao vivo anteriores.
  • Gemini 3.5 Live Experimental – Uma variante de raciocínio de nível superior que narra seu próprio pensamento passo a passo enquanto resolve tarefas complexas.

Ambos os modelos ao vivo estão disponíveis atualmente em inglês no aplicativo Gemini para macOS e por meio do recurso de ditado Rambler no Android em algumas regiões.

Quem deve se beneficiar

Desenvolvedores podem incorporar um fluxo de “limpeza conforme a fala” em ferramentas de colaboração, plataformas de criação de conteúdo e assistentes de voz. Empresas podem gerar transcrições prontas para publicação, reduzindo a dependência de serviços de terceiros que cobram por minuto e impõem cláusulas rígidas de tratamento de dados. Criadores de conteúdo podem publicar legendas polidas sem uma etapa de edição separada, acelerando a entrega de vídeos e podcasts.

Quem pode sentir o impacto

Fornecedores especializados em transcrição que cobram taxas premium por diarização de locutor e tratamento de jargões podem ver a demanda diminuir, especialmente entre startups sensíveis a custos. O limite de três interlocutores do modelo também pode levar grandes organizações a buscarem soluções dedicadas que suportem mais participantes em uma única chamada.

Limites e questões em aberto

  • Contagem de interlocutores – Apenas três interlocutores podem ser distinguidos por arquivo; reuniões com painéis maiores ainda precisarão de ferramentas externas.
  • Lançamento de idiomas – O suporte multilíngue foi anunciado, mas os modelos ao vivo permanecem apenas em inglês, deixando os usuários de outros idiomas aguardando pela funcionalidade completa.
  • Privacidade – Como em qualquer serviço de fala baseado em nuvem, as empresas devem pesar a conveniência da infraestrutura do Google contra a necessidade de manter áudios sensíveis fora de servidores externos. Os termos do Google permitem a implantação local (on-premise) para certos clientes, mas essa opção ainda não é pública.

O que observar a seguir

O Google deu pistas de atualizações futuras que aumentarão o limite de interlocutores e expandirão a cobertura dos modelos ao vivo para idiomas adicionais. Observar os níveis de preços da API também será essencial; um custo por minuto elevado pode corroer os ganhos de produtividade para usuários de alto volume. Por fim, a curva de adoção entre os desenvolvedores revelará se a conveniência da remoção automática de palavras de preenchimento supera quaisquer erros residuais em vocabulários de nicho.

Resumo: O Gemini 3.5 Transcribe transforma a tarefa tediosa de refinar gravações de áudio em uma única chamada de API, fornecendo aos desenvolvedores uma ferramenta pronta para obter textos limpos e com identificação de locutores. Seu sucesso depende da rapidez com que o Google ampliar o suporte a idiomas, aumentar o limite de locutores e abordar as preocupações de privacidade corporativa.