Ir para o conteúdo

Gemini 3.5 Transcribe: nova IA de transcrição

Darius Z. Por Darius Z. 8 min de leitura
Smartphone em uma mesa de podcast exibindo uma onda sonora brilhante, ilustrando o lançamento do Gemini 3.5 Transcribe

Contém links de afiliados

O Gemini 3.5 Transcribe é o modelo de conversão de voz em texto mais preciso que o Google já lançou, segundo os próprios benchmarks da empresa e testes independentes, e entrou em pré-visualização pública em 26 de agosto de 2026. O modelo chega como duas APIs distintas: uma opção de streaming em tempo real para aplicativos de voz ao vivo e uma opção para áudio pré-gravado que adiciona identificação de falantes e marcação de tempo por palavra, pensada para podcasts, reuniões e entrevistas.

O Google construiu o novo modelo em torno de um modo de transcrição inteligente que identifica correções feitas no meio da frase, remove vícios de linguagem e formata o texto automaticamente, além do modo tradicional que transcreve palavra por palavra, padrão da maioria das ferramentas de voz. Testes independentes da Artificial Analysis apontam taxa de erro de palavras de 2,6% para áudio pré-gravado e 4,0% para streaming ao vivo, além de uma redução de 70% no tempo até a transcrição final na comparação com o Chirp 3, modelo que ele substitui. O lançamento já chega ao Gboard, ao Google Antigravity, ao AI Studio e ao app Gemini no macOS.

Pontos Principais

  • O Gemini 3.5 Transcribe entrou em pré-visualização pública em 26 de agosto de 2026, dividido entre a Live API em tempo real e a Interactions API para áudio pré-gravado, com identificação de falantes e marcação de tempo por palavra
  • A taxa de erro de palavras é de 2,6% em áudio pré-gravado e 4,0% em streaming ao vivo, segundo a Artificial Analysis, com transcrição final 70% mais rápida que o Chirp 3, modelo que ele substitui
  • Um modo de transcrição inteligente remove vícios de linguagem, entende as correções que a pessoa faz no meio da fala e formata o texto automaticamente, além do modo literal padrão e do suporte a vocabulário personalizado
  • O modelo cobre mais de 85 idiomas com detecção automática, lida bem com sotaques regionais e consegue trocar de idioma no meio da fala
  • Ele já roda no Rambler do Gboard, no Google Antigravity, no modo Build do AI Studio e no app Gemini para macOS, com suporte ao Chrome a caminho

IA de Voz e Transcrição no Mesmo Plano da ElevenLabs

A ElevenLabs já reúne text-to-speech de nível profissional, clonagem de voz, dublagem e seu próprio modelo de transcrição, o Scribe, em um só espaço de trabalho, disponível hoje e não apenas em pré-visualização.

Experimente a ElevenLabs Grátis →

Tempo real ou gravado: como funciona a API do Gemini Transcribe

O Gemini 3.5 Transcribe se divide em duas APIs pensadas para tarefas diferentes. A Live API, gemini-3.5-transcribe-live, transmite áudio continuamente nos dois sentidos e devolve o texto com latência abaixo de um segundo, ideal para agentes de voz e outros aplicativos que não podem esperar uma pausa na fala. Já a Interactions API, gemini-3.5-transcribe, processa áudio pré-gravado e adiciona identificação de falantes com marcação de tempo por palavra, exatamente o formato de que precisam editores de podcast e quem redige atas de reunião.

As duas APIs se comportam da mesma forma diante da fala real e desorganizada. O modo padrão, literal, transcreve exatamente o que foi dito, vícios de linguagem incluídos. Já um modo inteligente à parte resolve aquela correção que a gente faz no meio da frase numa conversa do dia a dia, como alguém dizendo “vamos nos encontrar terça, não, quarta”, elimina as hesitações do tipo “hã” e “ahn” e formata o resultado em vez de entregar um bloco de texto corrido.

O modelo também aceita vocabulário personalizado: basta informar termos técnicos, nomes de produtos ou grafias incomuns com antecedência para que ele se adapte em vez de arriscar um palpite. A Interactions API ainda identifica falantes diferentes e marca o tempo de cada um.

Informação: Mais de Três Pessoas Falando

A identificação de falantes é confiável para até três pessoas na mesma gravação. O Google classifica o suporte a quatro ou mais falantes como experimental, então gravações de grupos maiores e mesas-redondas podem precisar de ajustes manuais.

Qual é a precisão do Gemini 3.5 Transcribe?

Testes independentes confirmam o que o Google promete em precisão. A Artificial Analysis mediu taxa de erro de palavras de 2,6% em áudio pré-gravado pela Interactions API e de 4,0% em streaming ao vivo pela Live API, com o modelo se saindo bem em ambientes barulhentos e capturando corretamente sequências alfanuméricas como CEPs e números de pedido.

No benchmark multilíngue FLEURS, que testa a precisão em um conjunto amplo de idiomas, o modelo registrou taxa de erro de palavras de 5,04% para áudio não streaming e 5,50% para streaming.

2,6% Taxa de Erro, Áudio Pré-Gravado
4,0% Taxa de Erro, Streaming ao Vivo
70% Mais Rápido que o Chirp 3 até a Transcrição Final
85+ Idiomas Suportados

O Chirp 3, modelo de transcrição anterior do Google, é a base de comparação para esse número de 70%. O Google afirma que o modelo mais novo traz recursos inéditos além de uma taxa de erro menor, mas a diferença prática mais evidente é a velocidade: a Artificial Analysis registrou uma melhora de 70% no tempo até a transcrição final frente ao Chirp 3, algo que pesa mais nos casos de uso em tempo real da Live API, em que qualquer atraso é sentido na hora.

Onde você já pode usar o Gemini 3.5 Transcribe?

A disponibilidade varia por público. Desenvolvedores já podem testar o Gemini 3.5 Transcribe pela Gemini API no Google AI Studio e dentro do Google Antigravity. Empresas têm acesso à pré-visualização pública pela Gemini Enterprise Agent Platform, com o Gemini Enterprise for Customer Experience anunciado como “em breve”. Consumidores finais já encontram o modelo rodando dentro de quatro produtos:

Rambler no Gboard

Recurso do teclado Android, disponível em países e idiomas selecionados, que transforma fala solta e desorganizada em texto bem formatado e ainda permite editar por voz o que já foi transcrito

Google Antigravity

Usa o contexto da tela e, com permissão, o histórico de conversas para melhorar a precisão em detalhes como nomes de arquivos

Modo Build do AI Studio

Programação por voz no estilo vibe coding, ditando alterações em um projeto em vez de digitá-las

App Gemini no macOS

Por enquanto só em inglês, com comandos de voz que leem o contexto da tela para resumir arquivos locais ou gerar uma imagem na posição do cursor

O suporte ao Chrome está a caminho, para falar em vez de digitar em qualquer formulário ou campo de texto na web. No macOS, o modelo também consegue repassar uma tarefa para outro modelo do Gemini via function calling: pedir para gerar uma imagem ou analisar um arquivo no meio da conversa direciona a solicitação automaticamente, com o Gemini 3.5 Transcribe atuando como interface em vez de fazer esse trabalho sozinho.

Para quem cria conteúdo no dia a dia, os usos práticos combinam com as ferramentas que já fazem parte da rotina: transformar a gravação bruta de um podcast em uma transcrição pesquisável, rascunhar legendas antes de exportar um vídeo, ditar um roteiro em vez de digitá-lo, ou levar uma transcrição limpa para um dos melhores conversores de texto em voz com IA e gerar uma narração dublada em outro idioma. Como a documentação do Google lista o português do Brasil (pt-BR) entre os idiomas suportados, o recurso já serve para podcasters e criadores brasileiros que trabalham só em português, sem precisar gravar em inglês para aproveitar a transcrição inteligente. Plataformas para desenvolvedores como Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel e Vision Agents já oferecem suporte ao modelo, e entre as primeiras empresas a adotá-lo, Vivo, Intellitek Health e Lingopal citaram latência, precisão e cobertura de idiomas no feedback publicado pelo Google no lançamento.

A aposta do Google na transcrição como infraestrutura

O Google não deu ao lançamento de 26 de agosto uma página de produto própria nem uma tabela de preços. A empresa entregou o modelo como uma camada dentro de coisas que as pessoas já usam: um teclado, uma ferramenta de programação, o assistente nativo de um sistema operacional. É uma proposta bem diferente da que as plataformas dedicadas de IA de voz vêm fazendo.

A ElevenLabs construiu o negócio pelo caminho inverso, como uma plataforma em que a transcrição é um recurso entre vários, não uma utilidade escondida dentro de outros aplicativos. O próprio modelo de voz para texto da empresa, o Scribe, fica dentro de um espaço de trabalho que também cuida de text-to-speech, clonagem de voz e dublagem, voltado para quem quer uma ferramenta única, construída especificamente para produção de áudio. Um desenvolvedor que monta um agente de voz precisa de uma coisa; um editor de vídeo que só quer uma interface pronta, sem ter que aprender uma API, precisa de outra.

O que o Gemini 3.5 Transcribe muda é a régua mínima do mercado. Quando um modelo com essa precisão sai de graça dentro de um teclado, uma transcrição decente deixa de ser, por padrão, algo pelo qual o criador paga uma assinatura à parte, e as plataformas que disputam essa fatia do orçamento passam a precisar de um argumento mais forte do que apenas precisão. O Google vem avançando rápido com recursos do Gemini neste trimestre, de um botão para desativar a marca d’água em mídia gerada por IA até este lançamento de transcrição. O padrão se repete nas duas vezes: capacidade lançada como infraestrutura, não vendida como produto à parte. Vale a pena acompanhar de perto pelo nosso feed de notícias de IA.

Combine Suas Transcrições com a Dublagem da ElevenLabs

Uma transcrição limpa é o primeiro passo de um fluxo de dublagem. A ElevenLabs transforma esse roteiro em narrações em dezenas de idiomas, com clonagem de voz que preserva o tom original de quem fala.

Comece a Dublar com a ElevenLabs →

Perguntas Frequentes

O Gemini 3.5 Transcribe é gratuito?

O Google ainda não divulgou os preços da pré-visualização pública do Gemini 3.5 Transcribe. Desenvolvedores já podem testar o modelo pela Gemini API no Google AI Studio e no Google Antigravity, e o acesso do consumidor final pelo app Gemini no macOS e pelo Rambler no Gboard não tem cobrança separada, mas o anúncio não traz nenhuma tabela de preços de API para o período de pré-visualização.

Qual é a precisão do Gemini 3.5 Transcribe?

O Gemini 3.5 Transcribe registra taxa de erro de palavras de 2,6% em áudio pré-gravado e 4,0% em áudio em streaming ao vivo, segundo benchmarks independentes da Artificial Analysis. No benchmark multilíngue FLEURS, que cobre os principais idiomas, a taxa de erro fica em 5,04% para áudio não streaming e 5,50% para streaming, e o Google afirma que o modelo se sai bem em ambientes barulhentos e captura com precisão sequências alfanuméricas como CEPs e números de pedido.

Quantos idiomas o Gemini 3.5 Transcribe suporta?

O Gemini 3.5 Transcribe suporta mais de 85 idiomas, com detecção automática de idioma já embutida. O modelo também lida bem com sotaques regionais e consegue trocar de idioma no meio de uma conversa ao vivo sem que ninguém precise avisar qual idioma vem a seguir.

O que é o Rambler no Gboard?

Rambler é um recurso do Gboard para Android que usa o Gemini 3.5 Transcribe para transformar fala solta e desorganizada em texto bem formatado. Ele foi feito para ditados que não saem como uma frase arrumada na primeira tentativa, e permite editar por voz um texto que já foi transcrito, sem precisar redigitar tudo na mão.

Qual a diferença entre o Gemini 3.5 Transcribe e o Chirp 3?

O Gemini 3.5 Transcribe substitui o Chirp 3 como modelo de transcrição do Google, trazendo recursos novos, taxa de erro menor e tempo de resposta bem mais rápido. A Artificial Analysis mediu uma melhora de 70% no tempo até a transcrição final na comparação com o Chirp 3, além de recursos de transcrição inteligente, como remoção de vícios de linguagem e tratamento das correções feitas no meio da fala, que o Chirp 3 não oferecia.

Vale mais usar o Gemini 3.5 Transcribe ou uma plataforma de transcrição dedicada?

O Gemini 3.5 Transcribe é uma boa opção para quem já trabalha dentro do ecossistema do Google e para desenvolvedores que vão integrar a API em seus próprios aplicativos, já que a transcrição já vem embutida em ferramentas como Gboard, Antigravity e AI Studio. Uma plataforma dedicada serve melhor para produção de áudio profissional: a ElevenLabs combina seu próprio modelo de transcrição, o Scribe, com text-to-speech, clonagem de voz e dublagem em um só espaço de trabalho, pensado para equipes cujo resultado final é áudio pronto, não uma transcrição bruta.

O Gemini 3.5 Transcribe funciona em português?

Sim. A documentação do Google lista o português do Brasil (pt-BR) e o de Portugal (pt-PT) entre os mais de 85 idiomas com detecção automática do Gemini 3.5 Transcribe, então podcasters e criadores brasileiros podem gravar direto em português sem precisar passar pelo inglês antes de transcrever. O Rambler no Gboard entrou no ar como parte do lançamento geral do recurso, mas o Google ainda trata a disponibilidade do Rambler fora dos Estados Unidos como restrita a "países selecionados", sem confirmar a lista completa.


Fontes

  1. Google: Gemini 3.5 Transcribe - Google, 26 de agosto de 2026
  2. 9to5Google: Gemini 3.5 Transcribe - 9to5Google, 26 de agosto de 2026
  3. Business Today: Google launches Gemini 3.5 Transcribe with smarter speech-to-text and 85 language support - Business Today, 27 de agosto de 2026
  4. Google AI for Developers: Transcribe audio - Documentação do Google AI

Este artigo foi útil?

0:00