Aller au contenu

Gemini 3.5 Transcribe : la dictée vocale IA de Google

Darius Z. Par Darius Z. 8 min de lecture
Smartphone sur un bureau de podcast affichant une forme d'onde audio lumineuse et Gemini 3.5 Transcribe

Contient des liens d'affiliation

Gemini 3.5 Transcribe est, selon les propres benchmarks de Google et des tests indépendants, le modèle de reconnaissance vocale le plus précis jamais publié par l’entreprise. Il est entré en préversion publique le 26 août 2026, sous la forme de deux API distinctes : une option de diffusion audio en temps réel pour les applications vocales en direct, et une option pour l’audio préenregistré qui ajoute l’identification des locuteurs et un horodatage mot par mot, pensée pour les podcasts, les réunions et les interviews.

Le nouveau modèle repose sur un mode de transcription intelligent qui repère les corrections faites en cours de phrase, supprime les hésitations et met en forme le texte automatiquement, en plus du mode verbatim classique que proposent la plupart des outils de dictée. Selon les tests indépendants d’Artificial Analysis, le taux d’erreur atteint 2,6% sur l’audio préenregistré et 4,0% en direct, avec un délai d’obtention de la transcription finale réduit de 70% par rapport à Chirp 3, le modèle qu’il remplace. Le déploiement couvre déjà Gboard, Google Antigravity, AI Studio et l’app Gemini sur macOS.

Points Clés

  • Gemini 3.5 Transcribe est entré en préversion publique le 26 août 2026, réparti entre une API Live en temps réel et une API Interactions pour l'audio préenregistré, avec identification des locuteurs et horodatage mot par mot
  • Le taux d'erreur atteint 2,6% sur l'audio préenregistré et 4,0% en direct selon Artificial Analysis, et le délai d'obtention de la transcription finale chute de 70% par rapport à Chirp 3, le modèle remplacé
  • Un mode de transcription intelligent supprime les hésitations, corrige les reprises en cours de phrase et met en forme le texte automatiquement, en complément du mode verbatim par défaut et d'un vocabulaire personnalisable
  • Le modèle couvre plus de 85 langues avec détection automatique, reconnaît les accents régionaux et peut changer de langue en cours de conversation
  • Il alimente déjà Rambler sur Gboard, Google Antigravity, le mode Build d'AI Studio et l'app Gemini sur macOS, avec une prise en charge de Chrome annoncée pour bientôt

Voix IA et transcription réunies dans un seul abonnement ElevenLabs

ElevenLabs regroupe déjà la synthèse vocale de qualité professionnelle, le clonage de voix, le doublage et son propre modèle de transcription Scribe dans un seul espace de travail, disponible dès aujourd'hui et non en préversion.

Essayez ElevenLabs gratuitement →

En direct ou enregistré : les deux API de Gemini Transcribe

Gemini 3.5 Transcribe se décline en deux API pensées pour des usages différents. L’API Live, gemini-3.5-transcribe-live, diffuse l’audio en continu dans les deux sens et renvoie le texte avec une latence inférieure à la seconde, pour les agents vocaux et les applications qui ne peuvent pas attendre une pause dans la parole. L’API Interactions, gemini-3.5-transcribe, traite l’audio préenregistré et ajoute l’identification des locuteurs avec un horodatage mot par mot, le format dont ont besoin les monteurs de podcasts et les rédacteurs de comptes rendus de réunion.

Les deux API gèrent de la même façon les imperfections de la parole réelle. Le mode par défaut, verbatim, transcrit exactement ce qui a été dit, hésitations comprises. À côté, un mode intelligent corrige les reprises typiques d’une conversation ordinaire, comme quelqu’un qui dit « on se voit mardi, non, mercredi », supprime les « euh » et met en forme le résultat au lieu de livrer un bloc de texte brut.

Le modèle accepte aussi un vocabulaire personnalisé. Fournissez-lui à l’avance du jargon, des noms de produits ou des orthographes inhabituelles, et il s’y adapte au lieu de deviner. L’API Interactions sait aussi distinguer plusieurs locuteurs et horodater chacun d’eux.

Info: Plus de trois locuteurs

L’identification des locuteurs est fiable jusqu’à trois personnes dans un même enregistrement. Google qualifie d’expérimentale la prise en charge de quatre locuteurs ou plus : les enregistrements réunissant plus de participants et les tables rondes peuvent donc nécessiter une correction manuelle.

Quelle est la précision de Gemini 3.5 Transcribe ?

Des tests indépendants confirment les chiffres avancés par Google. Artificial Analysis a mesuré un taux d’erreur de 2,6% sur l’audio préenregistré via l’API Interactions et de 4,0% en direct via l’API Live, le modèle se comportant bien dans les environnements bruyants et retranscrivant correctement les chaînes alphanumériques comme les codes postaux ou les numéros de commande.

Sur le benchmark multilingue FLEURS, qui évalue la précision sur un large éventail de langues, le modèle affiche un taux d’erreur de 5,04% pour l’audio préenregistré et de 5,50% pour l’audio en direct.

2,6% Taux d'erreur, audio préenregistré
4,0% Taux d'erreur, audio en direct
70% Transcription finale plus rapide que Chirp 3
85+ Langues prises en charge

Chirp 3, le précédent modèle de transcription de Google, sert de référence pour ce chiffre de 70%. Google met en avant de nouvelles capacités en plus d’un taux d’erreur réduit, mais la différence la plus concrète reste la vitesse : Artificial Analysis a mesuré une amélioration de 70% du temps de transcription finale par rapport à Chirp 3, un gain qui compte surtout dans les usages en direct de l’API Live, où le moindre délai se fait sentir immédiatement.

Où utiliser Gemini 3.5 Transcribe dès aujourd’hui ?

La disponibilité varie selon le public. Les développeurs peuvent dès maintenant tester Gemini 3.5 Transcribe via l’API Gemini dans Google AI Studio et dans Google Antigravity. Les entreprises y accèdent en préversion publique via la Gemini Enterprise Agent Platform, Gemini Enterprise for Customer Experience étant annoncé pour bientôt. Du côté grand public, le modèle tourne déjà dans quatre produits :

Rambler sur Gboard

Fonction du clavier Android, disponible dans certains pays et langues, qui transforme une parole décousue et non structurée en texte proprement mis en forme, avec des corrections vocales sur ce qui a déjà été transcrit

Google Antigravity

Utilise le contexte de l'écran et, avec autorisation, l'historique des échanges pour améliorer la précision sur des détails comme les noms de fichiers

Mode Build d'AI Studio

Programmation pilotée à la voix façon vibe coding, pour dicter des modifications à un projet plutôt que de les taper

App Gemini sur macOS

Pour l'instant réservée à l'anglais, avec des commandes vocales qui lisent le contexte de l'écran pour résumer des fichiers locaux ou générer une image à l'endroit du curseur

La prise en charge de Chrome arrive bientôt, pour parler au lieu de taper dans n’importe quel formulaire ou champ de texte web. Sur macOS, le modèle peut aussi transmettre une tâche à un autre modèle Gemini via l’appel de fonction : il suffit de lui demander de générer une image ou d’analyser un fichier en pleine conversation pour que la requête soit redirigée automatiquement, Gemini 3.5 Transcribe servant d’interface sans exécuter lui-même la tâche.

Côté créateurs, les usages concrets rejoignent des outils déjà utilisés au quotidien : transformer l’enregistrement brut d’un podcast en transcription indexable, préparer des sous-titres avant l’export d’une vidéo, dicter un script au lieu de le taper, ou injecter une transcription propre dans l’un des meilleurs outils de synthèse vocale IA pour produire une voix off doublée dans une autre langue. Des plateformes pour développeurs comme Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel et Vision Agents le prennent déjà en charge, et les premiers utilisateurs, parmi lesquels Vivo, Intellitek Health et Lingopal, ont mis en avant la latence, la précision et la couverture linguistique dans les retours publiés par Google au lancement.

Le pari de Google : la transcription comme infrastructure

Google n’a pas donné à ce lancement du 26 août de page produit dédiée ni de grille tarifaire. Le modèle est livré comme une couche greffée sur des outils que les gens ont déjà sous la main : un clavier, un outil de programmation, l’assistant natif d’un système d’exploitation. C’est un positionnement différent de celui des plateformes de voix IA dédiées.

ElevenLabs a construit son activité à l’inverse, comme une plateforme où la transcription est une fonctionnalité parmi d’autres plutôt qu’un utilitaire discret intégré à d’autres applications. Son propre modèle de reconnaissance vocale, Scribe, s’intègre dans un espace de travail qui gère aussi la synthèse vocale, le clonage de voix et le doublage, pensé pour ceux qui veulent un outil dédié à la production audio. Un développeur qui assemble un agent vocal n’a pas les mêmes besoins qu’un monteur vidéo qui veut simplement une interface finie, sans API à apprendre.

Ce que Gemini 3.5 Transcribe déplace, c’est le niveau de référence. Quand un modèle aussi précis débarque gratuitement dans une application clavier, une transcription correcte cesse par défaut d’être une ligne d’abonnement à part pour un créateur, et les plateformes qui se disputent ce budget doivent justifier leur prix autrement que par la seule précision. Google a avancé vite sur les fonctionnalités Gemini ce trimestre, entre une option pour masquer le filigrane des contenus générés par IA et ce lancement de transcription. Même logique dans les deux cas : une capacité livrée comme une brique d’infrastructure, pas vendue comme un produit à part entière. À surveiller, aux côtés de notre fil d’actualité IA.

Associez vos transcriptions au doublage ElevenLabs

Une transcription propre est la première étape d'un pipeline de doublage. ElevenLabs transforme ce script en voix off dans des dizaines de langues, avec un clonage vocal qui préserve le ton du locuteur d'origine.

Démarrez le doublage avec ElevenLabs →

Questions fréquentes

Gemini 3.5 Transcribe est-il gratuit ?

Google n'a publié aucun tarif de préversion publique pour Gemini 3.5 Transcribe. Les développeurs peuvent le tester dès maintenant via l'API Gemini dans Google AI Studio et Google Antigravity, et l'accès grand public via l'app Gemini sur macOS ou Rambler sur Gboard ne facture rien de séparé, mais l'annonce ne mentionne aucun tarif d'API pour cette préversion.

Quelle est la précision de Gemini 3.5 Transcribe ?

Gemini 3.5 Transcribe affiche un taux d'erreur de 2,6% sur l'audio préenregistré et de 4,0% sur l'audio en direct, selon les benchmarks indépendants d'Artificial Analysis. Sur le benchmark multilingue FLEURS, le taux d'erreur atteint 5,04% pour l'audio préenregistré et 5,50% pour l'audio en direct ; Google indique que le modèle se comporte bien dans le bruit et retranscrit avec précision les chaînes alphanumériques comme les codes postaux ou les numéros de commande.

Combien de langues Gemini 3.5 Transcribe prend-il en charge ?

Gemini 3.5 Transcribe prend en charge plus de 85 langues, avec détection automatique intégrée. Le modèle reconnaît aussi les accents régionaux et peut changer de langue en cours de conversation en direct, sans qu'on lui indique à l'avance quelle langue arrive.

Qu'est-ce que Rambler sur Gboard ?

Rambler est une fonction de Gboard pour Android qui s'appuie sur Gemini 3.5 Transcribe pour transformer une parole décousue et non structurée en texte proprement mis en forme. Elle est pensée pour la dictée qui ne sort pas sous forme de phrase nette du premier coup, et permet de corriger à la voix un texte déjà transcrit plutôt que de tout retaper à la main.

Rambler et Gemini 3.5 Transcribe sont-ils disponibles en France ?

Pour la langue, oui : la documentation officielle de Google recense le français (fr-FR) parmi les langues prises en charge par Gemini 3.5 Transcribe. Le déploiement de Rambler sur Gboard, lui, se fait par vagues de pays dont Google n'a pas publié la liste, et rien n'indique encore si les comptes français figurent dans la première. Les API, elles, sont accessibles aux développeurs français via Google AI Studio comme partout ailleurs.

En quoi Gemini 3.5 Transcribe diffère-t-il de Chirp 3 ?

Gemini 3.5 Transcribe remplace Chirp 3 comme modèle de transcription de Google, avec de nouvelles capacités, un taux d'erreur réduit et des temps de réponse nettement plus rapides. Artificial Analysis a mesuré une amélioration de 70% du temps de transcription finale par rapport à Chirp 3, en plus de fonctions de transcription intelligente, comme la suppression des hésitations et la gestion des reprises, que Chirp 3 n'offrait pas.

Faut-il utiliser Gemini 3.5 Transcribe ou une plateforme de transcription dédiée ?

Gemini 3.5 Transcribe convient à ceux qui travaillent déjà dans l'écosystème Google et aux développeurs qui intègrent l'API à leurs propres applications, puisque la transcription est incluse dans des outils comme Gboard, Antigravity et AI Studio. Une plateforme dédiée reste mieux adaptée à la production audio : ElevenLabs associe son propre modèle de transcription, Scribe, à la synthèse vocale, au clonage de voix et au doublage dans un seul espace de travail, pensé pour les équipes dont le livrable final est de l'audio fini, et non une simple transcription brute.


Sources

  1. Google : Gemini 3.5 Transcribe - Google, 26 août 2026
  2. 9to5Google : Gemini 3.5 Transcribe - 9to5Google, 26 août 2026
  3. Business Today : Google lance Gemini 3.5 Transcribe, une transcription vocale plus intelligente avec 85 langues prises en charge - Business Today, 27 août 2026
  4. Documentation Google AI for Developers : transcrire l’audio - Documentation Google AI

Cet article vous a-t-il été utile ?

0:00