Vai al contenuto

Gemini 3.5 Transcribe: la nuova trascrizione IA

Darius Z. Di Darius Z. 8 min di lettura
Smartphone su una scrivania da podcast con una forma d'onda audio luminosa, che illustra il lancio di Gemini 3.5 Transcribe

Contiene link di affiliazione

Gemini 3.5 Transcribe è il modello di trascrizione vocale più preciso mai rilasciato da Google, secondo i suoi stessi benchmark e secondo test indipendenti, ed è entrato in anteprima pubblica il 26 agosto 2026. Il modello arriva sotto forma di due API distinte. Una gestisce lo streaming in tempo reale, per le app vocali dal vivo; l’altra lavora sull’audio già registrato, aggiunge etichette per ogni speaker e timestamp parola per parola ed è pensata per podcast, riunioni e interviste.

Google ha costruito il nuovo modello attorno a una modalità di trascrizione intelligente che riconosce le autocorrezioni a metà frase, elimina le parole riempitive e formatta il risultato in automatico, oltre alla tradizionale trascrizione parola per parola su cui la maggior parte degli strumenti vocali si appoggia di default. I test indipendenti di Artificial Analysis rilevano un tasso di errore (word error rate) del 2,6% sull’audio registrato e del 4,0% sullo streaming live, con un taglio del 70% nel tempo necessario per arrivare alla trascrizione definitiva rispetto a Chirp 3, il modello a cui subentra. La distribuzione ha già toccato Gboard, Google Antigravity, AI Studio e l’app Gemini per macOS.

Punti Chiave

  • Gemini 3.5 Transcribe è entrato in anteprima pubblica il 26 agosto 2026, diviso tra la Live API in tempo reale e l'Interactions API per audio registrato, con riconoscimento degli speaker e timestamp parola per parola
  • Il tasso di errore è del 2,6% sull'audio registrato e del 4,0% sullo streaming live secondo Artificial Analysis, con una trascrizione finale più veloce del 70% rispetto a Chirp 3, il modello sostituito
  • Una modalità di trascrizione intelligente elimina i riempitivi, risolve le autocorrezioni e formatta il testo in automatico, accanto alla modalità verbatim predefinita e al supporto per vocabolari personalizzati
  • Il modello copre oltre 85 lingue con rilevamento automatico, gestisce gli accenti regionali e può cambiare lingua a metà di uno streaming
  • Alimenta già Rambler su Gboard, Google Antigravity, la modalità Build di AI Studio e l'app Gemini per macOS, con il supporto a Chrome in arrivo

IA vocale e trascrizione in un solo piano ElevenLabs

ElevenLabs riunisce già text-to-speech di qualità professionale, clonazione vocale, doppiaggio e il proprio modello di trascrizione Scribe in un solo spazio di lavoro, disponibile oggi e non solo in anteprima.

Prova ElevenLabs gratis →

In diretta o registrato: le due API di Gemini Transcribe

Gemini 3.5 Transcribe si divide in due API pensate per compiti diversi. La Live API, gemini-3.5-transcribe-live, trasmette audio in streaming continuo in entrambe le direzioni e restituisce testo con una latenza sotto il secondo: è la strada per gli agenti vocali e per tutte le app che non possono aspettare una pausa nel parlato. L’Interactions API, gemini-3.5-transcribe, elabora audio già registrato e aggiunge l’attribuzione degli speaker con timestamp parola per parola, il formato che serve a chi monta podcast o prende appunti di riunione.

Entrambe le API gestiscono allo stesso modo il parlato reale, con tutte le sue imperfezioni. La modalità predefinita, verbatim, trascrive esattamente quello che è stato detto, riempitivi compresi. Una modalità smart separata risolve le autocorrezioni tipiche del parlato di tutti i giorni, come quando qualcuno dice “ci vediamo martedì, anzi no, mercoledì”, elimina gli “ehm” e le esitazioni e formatta il risultato invece di lasciare un muro di testo piatto.

È supportato anche un vocabolario personalizzato. Basta fornire in anticipo gergo tecnico, nomi di prodotto o grafie insolite perché il modello si adatti invece di tirare a indovinare. L’Interactions API può inoltre distinguere i singoli speaker e assegnare un timestamp a ciascuno.

Info: Più di tre speaker

Il riconoscimento degli speaker è affidabile fino a tre persone nella stessa registrazione. Google definisce sperimentale il supporto per quattro o più speaker, quindi registrazioni di gruppo più ampie e tavole rotonde potrebbero richiedere una revisione manuale.

Quanto è preciso Gemini 3.5 Transcribe?

I test indipendenti confermano quanto dichiarato da Google sulla precisione del riconoscimento vocale di Gemini 3.5 Transcribe. Artificial Analysis ha misurato un tasso di errore del 2,6% sull’audio registrato tramite l’Interactions API e del 4,0% sullo streaming live tramite la Live API, con il modello che tiene bene anche in ambienti rumorosi e trascrive correttamente stringhe alfanumeriche come codici postali e numeri d’ordine.

Sul benchmark multilingue FLEURS, che misura la precisione su un ampio ventaglio di lingue, il modello ha ottenuto un tasso di errore del 5,04% per l’audio non in streaming e del 5,50% per lo streaming.

2,6% Tasso di errore, audio registrato
4,0% Tasso di errore, streaming live
70% Trascrizione finale più veloce vs. Chirp 3
85+ Lingue supportate

Chirp 3, il precedente modello di trascrizione di Google, è il termine di paragone per quel dato del 70%. Google dichiara che il nuovo modello porta nuove funzionalità oltre a un tasso di errore più basso, ma la differenza pratica più evidente è la velocità: Artificial Analysis ha misurato un miglioramento del 70% nel tempo che serve per arrivare alla trascrizione definitiva rispetto a Chirp 3, un dato che conta soprattutto nei casi d’uso in tempo reale della Live API, dove il ritardo si nota subito.

Dove si usa già Gemini 3.5 Transcribe?

La disponibilità cambia a seconda del pubblico. Gli sviluppatori possono già testare Gemini 3.5 Transcribe tramite la Gemini API in Google AI Studio e dentro Google Antigravity. Le aziende lo trovano in anteprima pubblica attraverso la Gemini Enterprise Agent Platform, mentre Gemini Enterprise for Customer Experience è indicato come “in arrivo”. Gli utenti finali, invece, se lo ritrovano già dentro quattro prodotti:

Rambler su Gboard

Funzione della tastiera Android che trasforma un parlato confuso e senza struttura in testo formattato in modo pulito, con la possibilità di modificare a voce quanto già trascritto

Google Antigravity

Usa il contesto dello schermo e, con il permesso dell'utente, la cronologia delle chat per migliorare la precisione su dettagli come i nomi dei file

AI Studio Build Mode

Programmazione vocale in stile vibe coding: si dettano le modifiche a un progetto invece di digitarle

App Gemini per macOS

Per ora solo in inglese, con comandi vocali che leggono il contesto dello schermo per riassumere file locali o generare un'immagine nella posizione del cursore

Il supporto a Chrome è in arrivo, per parlare invece di digitare in qualsiasi modulo web o campo di testo. Su macOS, il modello può anche passare un compito a un altro modello Gemini tramite function calling: se a metà conversazione gli si chiede di generare un’immagine o di analizzare un file, la richiesta viene instradata in automatico e Gemini 3.5 Transcribe fa da interfaccia invece di svolgere direttamente quel lavoro.

Per chi crea contenuti, le applicazioni pratiche si incastrano con gli strumenti che già usa ogni giorno: trasformare una registrazione podcast grezza in una trascrizione ricercabile, abbozzare i sottotitoli prima di esportare un video, dettare una scaletta invece di scriverla a mano, oppure dare in pasto una trascrizione pulita a uno dei migliori strumenti di text-to-speech IA per produrre un voiceover doppiato in un’altra lingua. Piattaforme per sviluppatori come Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel e Vision Agents lo supportano già, e i primi utenti come Vivo, Intellitek Health e Lingopal hanno citato latenza, precisione e copertura linguistica nei feedback pubblicati da Google al lancio. Rambler, per ora, è attivo solo in alcuni paesi e in alcune lingue: conviene controllare direttamente in Gboard prima di darlo per scontato sul proprio telefono.

La scommessa di Google: la trascrizione come infrastruttura

Per il lancio del 26 agosto, Google non ha creato né una pagina prodotto a sé stante né un listino prezzi. Ha distribuito il modello come uno strato dentro cose che le persone usano già: una tastiera, uno strumento di programmazione, l’assistente integrato di un sistema operativo. È un approccio diverso da quello delle piattaforme vocali IA dedicate.

ElevenLabs ha costruito il proprio business nella direzione opposta, come piattaforma dove la trascrizione è una funzione tra tante e non un’utility di sfondo integrata in altre app. Il suo modello di speech-to-text, Scribe, vive dentro uno spazio di lavoro che gestisce anche text-to-speech, clonazione vocale e doppiaggio, pensato per chi vuole uno strumento costruito apposta per la produzione audio. Uno sviluppatore che assembla un agente vocale ha esigenze diverse da un montatore video che vuole solo un’interfaccia già pronta, non un’API da imparare.

Quello che cambia con Gemini 3.5 Transcribe è il punto di partenza. Quando un modello così preciso arriva gratis dentro la tastiera del telefono, una trascrizione decente smette di essere qualcosa per cui i creator pagano un abbonamento a parte di default, e le piattaforme che competono per quel budget hanno bisogno di una ragione più chiara della sola precisione. In questo trimestre Google ha spinto forte sulle funzioni Gemini, dall’interruttore per la filigrana dei contenuti generati con IA fino a questo lancio della trascrizione. Lo schema si ripete: una capacità distribuita come infrastruttura, non venduta come prodotto a sé. Vale la pena tenerlo d’occhio insieme al nostro feed di notizie IA.

Abbina le tue trascrizioni al doppiaggio ElevenLabs

Una trascrizione pulita è il primo passo di una pipeline di doppiaggio. ElevenLabs trasforma quel copione in voiceover in decine di lingue, con una clonazione vocale che mantiene intatto il tono della voce originale.

Inizia a doppiare con ElevenLabs →

Domande Frequenti

Gemini 3.5 Transcribe è gratuito?

Google non ha pubblicato un listino prezzi per l'anteprima pubblica di Gemini 3.5 Transcribe. Gli sviluppatori possono già testarlo tramite la Gemini API in Google AI Studio e Google Antigravity, e l'accesso consumer attraverso l'app Gemini per macOS e Rambler su Gboard non comporta un costo separato, ma l'annuncio non elenca tariffe API per la fase di anteprima.

Quanto è preciso Gemini 3.5 Transcribe?

Secondo i benchmark indipendenti di Artificial Analysis, Gemini 3.5 Transcribe registra un tasso di errore del 2,6% sull'audio registrato e del 4,0% sullo streaming live. Sul benchmark multilingue FLEURS, calcolato sulle lingue principali, il tasso di errore è del 5,04% per l'audio non in streaming e del 5,50% per lo streaming; Google dichiara inoltre che il modello tiene bene in ambienti rumorosi e trascrive con precisione stringhe alfanumeriche come codici postali e numeri d'ordine.

Quante lingue supporta Gemini 3.5 Transcribe?

Gemini 3.5 Transcribe supporta oltre 85 lingue, italiano compreso, con rilevamento automatico della lingua integrato. Il modello gestisce anche gli accenti regionali e può cambiare lingua a metà di una conversazione live senza che gli venga detto in anticipo quale lingua arriverà.

Cos'è Rambler su Gboard?

Rambler è una funzione di Gboard per Android che usa Gemini 3.5 Transcribe per trasformare un parlato confuso e senza struttura in testo formattato in modo pulito. È pensata per la dettatura che non esce come una frase ordinata al primo tentativo, e permette di modificare a voce un testo già trascritto invece di riscriverlo a mano.

In cosa Gemini 3.5 Transcribe è diverso da Chirp 3?

Gemini 3.5 Transcribe prende il posto di Chirp 3 come modello di trascrizione di Google, con nuove funzionalità, un tasso di errore più basso e tempi di risposta nettamente più veloci. Artificial Analysis ha misurato un miglioramento del 70% nel tempo necessario per ottenere la trascrizione finale rispetto a Chirp 3, oltre a funzioni di trascrizione intelligente come l'eliminazione dei riempitivi e la gestione delle autocorrezioni che Chirp 3 non offriva.

Meglio Gemini 3.5 Transcribe o una piattaforma di trascrizione dedicata?

Gemini 3.5 Transcribe è adatto a chi lavora già dentro gli strumenti Google e agli sviluppatori che integrano l'API nelle proprie app, dato che la trascrizione arriva già insieme a strumenti come Gboard, Antigravity e AI Studio. Una piattaforma dedicata si adatta meglio alla produzione audio professionale: ElevenLabs abbina il proprio modello di trascrizione, Scribe, a text-to-speech, clonazione vocale e doppiaggio in un solo spazio di lavoro, pensato per team il cui risultato finale è audio pronto, non una trascrizione grezza.


Fonti

  1. Google: Gemini 3.5 Transcribe - Google, 26 agosto 2026
  2. 9to5Google: Gemini 3.5 Transcribe - 9to5Google, 26 agosto 2026
  3. Business Today: Google launches Gemini 3.5 Transcribe with smarter speech-to-text and 85 language support - Business Today, 27 agosto 2026
  4. Google AI for Developers: Transcribe audio - Google AI Documentation

Questo articolo ti è stato utile?

0:00