Reseña ElevenCreative 2026: Voz, Música y Video
ElevenCreative da 10.000 créditos gratis al mes, luego de $6 a $99. Repasamos Studio, Flows, Music v2 y Dubbing v2, y dónde muerde el sistema de créditos.
Leer Artículo →
Gemini 3.5 Transcribe es el modelo de voz a texto más preciso que ha lanzado Google hasta ahora, tanto por sus propios benchmarks como por pruebas independientes, y entró en vista previa pública el 26 de agosto de 2026. Llega partido en dos APIs: una de transmisión en tiempo real, pensada para apps de voz en vivo, y otra para audio ya grabado, que añade etiquetas de hablante y marcas de tiempo por palabra para podcasts, reuniones y entrevistas.
Google ha construido el modelo nuevo en torno a un modo de transcripción inteligente que detecta las correcciones a mitad de frase, elimina las muletillas y da formato al resultado por su cuenta, además de la transcripción literal palabra por palabra que la mayoría de las herramientas de voz ofrecen por defecto. Las pruebas independientes de Artificial Analysis sitúan la tasa de error de palabra (word error rate, o WER) en el 2,6% para audio grabado y el 4,0% para transmisión en vivo, junto a un recorte del 70% en el tiempo hasta la transcripción final frente a Chirp 3, el modelo al que sustituye. El despliegue ya llega a Gboard, Google Antigravity, AI Studio y la app de Gemini en macOS.
ElevenLabs ya combina texto a voz de nivel profesional, clonación de voz, doblaje y su propio modelo de transcripción Scribe en un solo espacio de trabajo, disponible hoy y no en fase de vista previa.
Prueba ElevenLabs gratis →Gemini 3.5 Transcribe se divide en dos APIs pensadas para trabajos distintos. La Live API, gemini-3.5-transcribe-live, transmite audio de forma continua en ambas direcciones y devuelve el texto con una latencia inferior al segundo, pensada para agentes de voz y otras apps que no pueden esperar a una pausa en el habla. La Interactions API, gemini-3.5-transcribe, procesa audio ya grabado y añade identificación de hablantes con marcas de tiempo por palabra, el formato que necesitan los editores de podcasts y las actas de reuniones.
Las dos APIs comparten el mismo comportamiento frente al habla real, con todo su desorden. El modo por defecto, verbatim, transcribe exactamente lo que se dijo, muletillas incluidas. Un modo inteligente aparte resuelve las autocorrecciones típicas de cualquier conversación, como cuando alguien dice “quedamos el martes, no, el miércoles”, elimina muletillas como “eh” o “mmm”, y da formato al resultado en lugar de dejarlo como un bloque de texto plano.
También admite vocabulario personalizado. Si le proporcionas de antemano jerga técnica, nombres de producto o grafías poco habituales, el modelo se adapta en lugar de adivinar. La Interactions API además identifica a cada hablante por separado y marca el momento exacto en el que interviene.
La identificación de hablantes funciona de forma fiable con hasta tres personas en la misma grabación. Google marca el soporte para cuatro hablantes o más como experimental, así que las grabaciones de grupos grandes y las mesas redondas pueden necesitar una revisión manual.
Las pruebas independientes respaldan lo que dice Google. Artificial Analysis midió una tasa de error de palabra del 2,6% en audio grabado a través de la Interactions API y del 4,0% en transmisión en vivo a través de la Live API, con un modelo que aguanta bien en entornos ruidosos y capta con precisión cadenas alfanuméricas como códigos postales y números de pedido.
En el benchmark multilingüe FLEURS, que mide la precisión en un conjunto amplio de idiomas, el modelo obtuvo una tasa de error de palabra del 5,04% en audio no transmitido en vivo y del 5,50% en transmisión en vivo.
Chirp 3, el modelo de transcripción anterior de Google, es la referencia de la que sale esa cifra del 70%. Google dice que el modelo nuevo suma capacidades además de una tasa de error menor, pero la diferencia práctica más clara es la velocidad: Artificial Analysis registró una mejora del 70% en el tiempo hasta la transcripción final frente a Chirp 3, algo que se nota sobre todo en los casos de uso en tiempo real de la Live API, donde cualquier retraso se percibe al instante.
La disponibilidad varía según el tipo de usuario. Los desarrolladores ya pueden probar Gemini 3.5 Transcribe a través de la API de Gemini en Google AI Studio y dentro de Google Antigravity. Las empresas lo reciben en vista previa pública a través de la Gemini Enterprise Agent Platform, mientras que Gemini Enterprise for Customer Experience figura como disponible próximamente. Los usuarios particulares ya lo tienen funcionando dentro de cuatro productos:
Función del teclado de Android, disponible en países e idiomas seleccionados, que convierte un discurso desordenado y sin estructura en texto bien formateado, con ediciones por voz sobre lo que ya se ha transcrito
Usa el contexto de la pantalla y, con permiso, el historial de chat para mejorar la precisión en detalles como los nombres de archivo
Programación por voz al estilo vibe-coding: dictas los cambios en un proyecto en lugar de escribirlos
Por ahora solo en inglés, con comandos de voz que leen el contexto de la pantalla para resumir archivos locales o generar una imagen en la posición del cursor
El soporte para Chrome llega próximamente, para hablar en lugar de escribir en cualquier formulario web o campo de texto. En macOS, el modelo también puede pasarle una tarea a otro modelo de Gemini mediante function calling: pedirle que genere una imagen o analice un archivo a mitad de conversación enruta la solicitud automáticamente, con Gemini 3.5 Transcribe actuando como interfaz en lugar de hacer ese trabajo él mismo.
Para un creador en activo, los usos prácticos encajan con herramientas que ya forman parte de la rutina diaria: convertir la grabación en bruto de un podcast en una transcripción en la que buscar cualquier frase, redactar subtítulos antes de exportar un video, dictar un guion en lugar de escribirlo, o pasar una transcripción limpia a una de las mejores herramientas de texto a voz para producir una voz en off doblada a otro idioma. Plataformas para desarrolladores como Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel y Vision Agents ya son compatibles, y los primeros usuarios, entre ellos Vivo, Intellitek Health y Lingopal, destacaron la latencia, la precisión y la cobertura de idiomas en los comentarios que Google publicó en el lanzamiento.
Google no le dio al lanzamiento del 26 de agosto una página de producto propia ni una lista de precios. Lo lanzó como una capa dentro de cosas que la gente ya usa: un teclado, una herramienta de programación, el asistente integrado de un sistema operativo. Es un planteamiento distinto al que vienen defendiendo las plataformas de IA de voz dedicadas.
ElevenLabs construyó su negocio al revés: como una plataforma donde la transcripción es una función más entre varias, no una utilidad de fondo integrada en otras apps. Su propio modelo de voz a texto, Scribe, vive dentro de un espacio de trabajo que también se ocupa del texto a voz, la clonación de voz y el doblaje, pensado para quien quiere una sola herramienta hecha específicamente para producción de audio. Un desarrollador que está montando un agente de voz necesita algo distinto de lo que necesita un editor de video que solo quiere una interfaz terminada y no una API que aprender.
Lo que cambia Gemini 3.5 Transcribe es el punto de partida. Cuando un modelo tan preciso llega gratis dentro de una app de teclado, una transcripción decente deja de ser algo por lo que se da por hecho que hay que pagar una suscripción aparte, y las plataformas que compiten por ese presupuesto necesitan una razón más clara que la sola precisión. Google ha ido muy rápido con las funciones de Gemini este trimestre, desde un interruptor de marca de agua para contenido generado con IA hasta este lanzamiento de transcripción. El mismo patrón las dos veces: la capacidad se lanza como infraestructura, no se vende como producto aparte. Vale la pena seguirlo de cerca, igual que el resto de nuestro feed de noticias de IA.
Una transcripción limpia es el primer paso de un flujo de doblaje. ElevenLabs convierte ese guion en voces en off en decenas de idiomas, con clonación de voz que conserva intacto el tono del hablante original.
Empieza a doblar con ElevenLabs →Google no ha publicado precios de la vista previa pública de Gemini 3.5 Transcribe. Los desarrolladores ya pueden probarlo a través de la API de Gemini en Google AI Studio y Google Antigravity, y el acceso para particulares mediante la app de Gemini en macOS y Rambler en Gboard no tiene ningún coste aparte, pero el anuncio no incluye tarifas de API para esta fase de vista previa.
Gemini 3.5 Transcribe registra una tasa de error de palabra del 2,6% en audio grabado y del 4,0% en audio transmitido en vivo, según los benchmarks independientes de Artificial Analysis. En el benchmark multilingüe FLEURS, sobre los principales idiomas, la tasa de error de palabra es del 5,04% en audio no transmitido en vivo y del 5,50% en transmisión en vivo, y Google asegura que el modelo aguanta bien en entornos ruidosos y capta con precisión cadenas alfanuméricas como códigos postales y números de pedido.
Gemini 3.5 Transcribe admite más de 85 idiomas con detección automática de idioma incorporada. El modelo también maneja bien los acentos regionales y puede cambiar de idioma a mitad de una conversación en vivo sin que se le indique cuál viene a continuación.
Rambler es una función de Gboard para Android que usa Gemini 3.5 Transcribe para convertir un discurso desordenado y sin estructura en texto bien formateado. Está pensada para dictados que no salen como una frase ordenada a la primera, y permite editar por voz el texto ya transcrito en lugar de tener que volver a escribirlo a mano.
Gemini 3.5 Transcribe sustituye a Chirp 3 como modelo de transcripción de Google con nuevas funciones, una tasa de error menor y tiempos de respuesta notablemente más rápidos. Artificial Analysis midió una mejora del 70% en el tiempo hasta la transcripción final frente a Chirp 3, además de funciones de transcripción inteligente como la eliminación de muletillas y la gestión de autocorrecciones que Chirp 3 no ofrecía.
Gemini 3.5 Transcribe encaja bien con quienes ya trabajan dentro del ecosistema de Google y con los desarrolladores que integran la API en sus propias apps, porque la transcripción viene incluida en herramientas como Gboard, Antigravity y AI Studio. Una plataforma dedicada encaja mejor con la producción de audio profesional: ElevenLabs combina su propio modelo de transcripción, Scribe, con texto a voz, clonación de voz y doblaje en un solo espacio de trabajo, pensado para equipos cuyo resultado final es audio terminado y no una transcripción en bruto.
Sí. El español está entre los más de 85 idiomas que admite Gemini 3.5 Transcribe, con detección automática de idioma y manejo de acentos regionales. La documentación de Google recoge las variantes es-419 (América Latina) y es-US, y la detección automática hace el resto con el acento que le llegue. Un matiz práctico si trabajas desde el escritorio: la app de Gemini en macOS arranca solo en inglés, así que de momento el camino para dictar en español pasa por Gboard en Android o por la API.