Google DeepMind lanza Gemini 3.8 Flash TTS y Flash-Lite TTS, sus modelos de texto a voz más expresivos hasta la fecha
Puntos clave
- •Google DeepMind lanzó dos modelos de texto a voz: Gemini 3.8 Flash TTS, orientado al diseño expresivo de personajes y la dirección de escenas, y Gemini 3.8 Flash-Lite TTS, diseñado para generación de voz de alto volumen y bajo costo.
- •Los usuarios pueden diseñar voces originales mediante instrucciones en lenguaje natural, elegir entre una biblioteca de más de 2,000 voces listas para producción que abarcan más de 100 idiomas y dialectos, y replicar una voz a partir de una muestra de audio de 30 segundos.
- •Ambos modelos ofrecen control línea por línea sobre el ritmo, la emoción, las señales no verbales y la escenificación de dos hablantes, y pueden generar horas de audio continuo con una deriva mínima del hablante.
- •Google informa que Gemini 3.8 Flash TTS obtuvo el primer lugar en el Voice Design Benchmark de Hume AI con una puntuación de 71.4, y los dos modelos ocuparon los dos primeros puestos en el Overall Quality Index de Hume AI.
- •La replicación de voz requiere consentimiento verificado del propietario de la voz, todo el audio generado incluye marca de agua SynthID, y la replicación a través de AI Studio no está disponible en regiones como Illinois, Texas, el EEE, el Reino Unido, Suiza e India.

Google DeepMind anunció el 23 de septiembre de 2026 el lanzamiento de Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS, dos modelos de texto a voz que la empresa describe como sus modelos de generación de audio más expresivos hasta la fecha. Los modelos generan voces de personajes personalizadas y diálogos por escena completamente dirigidos, y se están implementando en Google AI Studio, la Gemini API, Gemini Enterprise, Gemini Notebook y Google Vids. El texto a voz se ha convertido en una área de rápido desarrollo dentro de la IA generativa, ya que la producción de audiolibros, los videojuegos, el doblaje y los agentes de voz en tiempo real impulsan la demanda de voz sintética que suene convincentemente humana.
El anuncio, publicado en el blog de Google DeepMind, fue escrito por Leland Rechis, Group Product Manager, y Alan Cowen, Director de Research Science, en nombre del equipo de Gemini Audio.
En su resumen, Google indica que los usuarios pueden crear voces personalizadas desde cero o replicar voces existentes con simples instrucciones en lenguaje natural, dirigir su audio línea por línea para controlar el ritmo, la emoción e incluso sonidos conversacionales realistas, y usar los modelos para audiolibros, podcasts o agentes de voz en tiempo real de alta calidad a gran escala. Se incluyen herramientas de seguridad integradas, como la marca de agua, para ayudar a mantener seguro el audio generado.
Dos modelos para diferentes cargas de trabajo
Google presenta el lanzamiento como una transformación de la generación de voz "de presets estáticos a un estudio creativo dinámico", que permite a creadores, desarrolladores y empresas construir experiencias de audio más ricas y expresivas. La empresa agrega que los modelos también mejoran la experiencia de usuario en sus propios productos, incluidos Gemini Notebook y Google Vids.
Gemini 3.8 Flash TTS está diseñado para la dirección creativa profunda y el diseño de personajes. Puede crear voces completamente nuevas desde cero mediante instrucciones en lenguaje natural para dar vida a personajes en videojuegos, audiolibros inmersivos, podcasts y medios interactivos. Los usuarios pueden dirigir cada interpretación línea por línea, con control granular sobre las indicaciones de actuación, el ritmo, los cambios de dialecto y la retroalimentación conversacional.
Gemini 3.8 Flash-Lite TTS está diseñado para una escala de alto volumen y bajo costo. Google indica que está optimizado para doblaje de alto volumen, creación de contenido de audio y agentes de voz expresivos, con control fino el tono, el ritmo y los matices expresivos. La división entre Flash y Flash-Lite sigue la convención de nombres que Google ya utiliza en la familia Gemini, donde las variantes Lite funcionan como opciones más ligeras y orientadas al costo para cargas de trabajo de alto rendimiento.
Los dos modelos complementan una familia Gemini Audio en rápido crecimiento que anteriormente incluía 3.5 Live Translate, 3.5 Transcribe, 3.8 Live y 3.8 Live Extended Thinking.
Crea y personaliza tus propias voces
Con los nuevos modelos, Google amplía su oferta de 30 voces originales a lo que denomina una biblioteca infinita. Ya sea que el objetivo sea una voz de personaje completamente original o un embajador de marca consistente, la empresa afirma que Gemini 3.8 Flash TTS funciona como un estudio vocal completo, permitiendo a los usuarios crear y desplegar voces expresivas y de sonido natural para cada momento, mientras desarrolladores y empresas construyen experiencias de audio personalizadas sobre esta base.
Las capacidades de creación de voces anunciadas hoy incluyen:
Diseño de voz generativo. Los usuarios pueden crear voces a medida desde cero con Gemini 3.8 Flash TTS personalizando el rol, el acento y las características de la voz en más de 100 idiomas y dialectos mediante instrucciones en lenguaje natural — ya sea, según los ejemplos de Google, dar vida a un dramático dragon escupefuego o crear un narrador carismático con una cadencia regional distintiva. Los clips de demostración publicados junto con el anuncio muestran al modelo generando una voz de DJ de alta energía de Melbourne, una voz de robot monótona y sumamente metálica, y un dragón japonés.
Biblioteca de voces extensa. La plataforma ofrece más de 2,000 voces listas para producción con amplia cobertura de idiomas, incluidas variedades regionales como español mexicano, francés quebequense e inglés escocés.
Replicación de voz. Los usuarios pueden recrear perfiles vocales consistentes a partir de una muestra de audio de 30 segundos de su propia voz, o de una voz cuya licencia de uso posean. La función cuenta con verificación de consentimiento integrada, marca de agua SynthID y credenciales C2PA — un estándar abierto de la industria para registrar de dónde proviene un medio y cómo fue producido — para proteger tanto a los desarrolladores como a sus talentos de voz.
Guardar y escalar. Las voces personalizadas se pueden guardar y administrar para asegurar un rendimiento consistente y una deriva mínima en proyectos en curso.
Remix de voces. Próximamente, los usuarios podrán elegir una voz de la biblioteca y ajustar su timbre, tono, ritmo y acento, usando instrucciones para definir características como "agregar un sutil acento del sur de EE. UU." o "suavizar la entonación".
Dirige la interpretación, línea por línea
Una vez seleccionadas las voces, ambos modelos TTS ofrecen a los usuarios control preciso sobre cómo se entrega cada línea. Los usuarios pueden sus propias acotaciones de dirección o dejar que Gemini guíe la interpretación con señales naturales del guion — desde un agente de servicio al cliente tranquilo hasta una escena de susurros de suspenso. Las demostraciones de Google muestran al modelo impulsando conversaciones naturales y altamente expresivas para agentes de voz interactivos, así como el control granular del guion usado para crear experiencias de audio inmersivas y atractivas y escenas de diálogo totalmente interpretadas con turnos de conversación naturales.
Otras capacidades de interpretación incluyen:
Generación de formato largo. Los modelos mantienen una alta calidad de voz, un ritmo natural y el timbre del personaje a lo largo de horas de audio continuo con una deriva mínima del hablante, lo que Google posiciona como ideal para podcasts y audiolibros.
Escenificación nativa de dos hablantes. Las conversaciones de varios turnos pueden dirigirse sin problemas desde un solo guion — ya sea para un podcast o para narrativa dramática — manteniendo ambas voces claramente diferenciadas con turnos de conversación naturales.
Expresiones vocales y retroalimentación conversacional con guion. Señales no verbales como <laughs>, <sigh> y <gasp>, junto con interjecciones de escucha activa como |mhm| o |yeah|, agregan textura conversacional realista para una sincronización cómica precisa y momentos de reacción.
Benchmarks y alcance multilingüe
Google informa que Gemini 3.8 Flash TTS ofrece capacidades líderes de personalización de voz, asegurando el puesto #1 general en el Voice Design Benchmark de Hume AI, una evaluación independiente de la empresa de investigación de IA enfocada en voz Hume AI, con una puntuación de 71.4, además de liderar en modelado de acentos con 60.8. La empresa agrega que Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS permiten interpretaciones expresivas sin sacrificar la confiabilidad, obteniendo los puestos #1 y #2, respectivamente, en el Overall Quality Index de Hume AI.
En comparación con Gemini 3.1 Flash TTS, Google afirma que el nuevo modelo muestra mejoras importantes en una amplia gama de casos de uso, incluido el contenido de formato largo y el control de guiones de dos hablantes.
En evaluaciones ciegas de preferencia humana en Voice Arena, donde los oyentes comparan muestras anónimas sin saber qué modelo las produjo, Gemini 3.8 Flash y Flash-Lite TTS obtuvieron posiciones de liderazgo entre sus competidores en idiomas globales clave, incluidos japonés, portugués de Brasil, vietnamita, árabe estándar moderno (MSA), español mexicano e hindi. Con soporte para más de 100 idiomas, la empresa afirma que los modelos permiten a creadores, desarrolladores y empresas construir experiencias de voz multilingües de alta calidad a nivel mundial.
Seguridad, consentimiento y transparencia
Google afirma que construyó las capacidades de creación y replic de voces con salvaguardas estrictas para ayudar a proteger a los talentos de voz, respetar la identidad y garantizar la transparencia del contenido. Para la replicación de voz, el sistema utiliza verificación de consentimiento: los usuarios deben proporcionar una grabación verbal de consentimiento del propietario de la voz que coincida con el hablante de referencia antes de poder crear una voz. Estas salvaguardas abordan uno de los riesgos más observados en el audio generativo: el uso indebido de voces clonadas para suplantación y fraude, lo que ha convertido los flujos de consentimiento y verificación en un punto central de los debates de política de IA.
De manera más amplia, cada clip de audio generado por los modelos Gemini Audio lleva la marca de agua SynthID, la tecnología de marca de agua de DeepMind para identificar contenido generado por IA. Google describe la marca de agua como imperceptible y entretejida directamente en la salida de audio, manteniendo detectable el habla generada por IA para ayudar a prevenir la desinformación. Detalles adicionales sobre el enfoque de la empresa en seguridad y responsabilidad están disponibles en la ficha del modelo de audio Gemini 3.8.
Google también señala una restricción regional: la replicación de voz a través de AI Studio no está disponible en Illinois, Texas, el Espacio Económico Europeo (EEE), el Reino Unido, Suiza e India.
Un espacio de trabajo de diseño de voces en Google AI Studio
A partir de hoy, los desarrolladores pueden probar las nuevas capacidades de generación de voz en Google AI Studio. Diseñada como un espacio de trabajo de diseño de voces, la herramienta permite a los usuarios generar identidades vocales completamente nuevas desde cero o replicar su propia voz, y luego llevarlas directamente a un editor de guiones de dos hablantes para dirigir la interpretación línea por línea.
Plataformas para desarrolladores y socios de lanzamiento
A través de la Gemini API, plataformas para desarrolladores como Agora, LiveKit, Pipecat y Vercel — un grupo que abarca infraestructura de comunicaciones en tiempo real, marcos de trabajo para agentes de voz y herramientas de despliegue — permiten a los desarrolladores crear y desplegar fácilmente experiencias de generación de voz de alto rendimiento.
Google también se está asociando con empresas como Figma, HeyGen, Linguana, Wondercraft, 99.co y Ollang, que están integrando los últimos modelos TTS para acelerar el doblaje global, localizar medios con acentos regionales matizados e impulsar agentes de voz conversacionales a gran escala.
Disponibilidad
Ambos modelos se están implementando a partir de hoy.
Gemini 3.8 Flash TTS:
- Para desarrolladores: disponible en la Gemini API y Google AI Studio.
- Para empresas: próximamente vía API en Gemini Enterprise.
- Para consumidores: disponible en Gemini Notebook.
Gemini 3.8 Flash-Lite TTS:
- Para desarrolladores: disponible en la Gemini API y Google AI Studio.
- Para empresas: próximamente vía API en Gemini Enterprise.
- Para consumidores: disponible en Google Vids.
Las capacidades que Google ha marcado como próximamente — el remix de voces y el acceso vía API a través de Gemini Enterprise — son los próximos hitos a observar a medida que el despliegue se ext más allá de los socios de lanzamiento y los puntos de acceso anticipado de hoy.
Con este lanzamiento, la línea Gemini Audio abarca traducción y transcripción en vivo, conversación de voz en tiempo real a través de 3.8 Live y 3.8 Live Extended Thinking, y ahora generación de voz expresiva, ofreciendo a creadores, desarrolladores y empresas una única familia de modelos para construir productos basados en voz.