NoticiasAccionesGoogle DeepMind lanza Gemini 3.8 Live y 3.8 Live Extended Thinking para IA de voz natural

Google DeepMind lanza Gemini 3.8 Live y 3.8 Live Extended Thinking para IA de voz natural

Autor: Google DeepMind Blog·

Puntos clave

  • Google DeepMind lanzó Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking el 15 de septiembre de 2026, describiéndolos como sus modelos de diálogo en vivo más avanzados hasta la fecha.
  • Gemini 3.8 Live Extended Thinking ocupó el primer lugar general en el Speech to Speech Quality Index de Artificial Analysis, con 68.6% en el benchmark agéntico τ-Voice y 97.7% en Big Bench Audio.
  • Los modelos procesan entradas visuales en tiempo casi real, cambian automáticamente entre 97 idiomas compatibles a mitad de la conversación y ejecutan herramientas y llamadas a API en segundo plano mientras la conversación continúa.
  • Gemini 3.8 Live está orientado a la escala y eficiencia de costos, mientras que Extended Thinking está diseñado para tareas de alta complejidad con razonamiento y habla simultáneos, incluida la narración de progreso en vivo.
  • Ambos modelos están disponibles a partir de hoy a través de la API de Gemini y Google AI Studio, con implementaciones para empresas y consumidores en Gemini Enterprise, Google Workspace, Search Live y la app de Gemini.
Google DeepMind lanza Gemini 3.8 Live y 3.8 Live Extended Thinking para IA de voz natural

Google DeepMind anunció el 15 de septiembre de 2026 el lanzamiento de Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, que la empresa describe como sus modelos de diálogo en vivo más avanzados hasta la fecha. Según el anuncio, los dos modelos aportan avances en razonamiento en tiempo casi real para habilitar de manera más efectiva a los agentes de voz, con mejoras importantes en inteligencia y razonamiento paralelo que los hacen más intuitivos para colaborar y más aptos para ejecutar tareas complejas mediante la voz.

La publicación fue escrita por Tom Ouyang, ingeniero principal, y Malini Jaganathan, miembro del equipo técnico, en nombre del equipo de audio de Gemini.

Google señaló que el lanzamiento busca hacer que las interacciones por voz sean más naturales, fluidas e inteligentes. Los nuevos modelos manejan razonamiento complejo, contexto visual en tiempo real y ejecución de tareas en segundo plano sin interrumpir la conversación en curso. Pueden gestionar interrupciones, cambiar entre idiomas e incluso explicar su proceso de razonamiento mientras trabajan, un comportamiento que Google caracteriza como un paso hacia una IA que se siente como un interlocutor real. Ya sea que los usuarios resuelvan un problema complejo o simplemente conversen, la empresa afirma que la experiencia está diseñada para que se sienta como si la IA estuviera escuchando y pensando junto con ellos. Las funciones están disponibles a partir de hoy a través de la API de Gemini, Google Workspace y la app de Gemini.

Los dos modelos apuntan a casos de uso distintos:

  • Gemini 3.8 Live está diseñado para escala y eficiencia de costos, combinando inteligencia conversacional con diálogo fluido y anclaje visual.
  • Gemini 3.8 Live Extended Thinking está diseñado para tareas de alta complejidad, con mayor inteligencia y razonamiento de múltiples pasos.

Para desarrolladores y empresas, Google presenta los modelos como los componentes básicos para agentes de voz confiables y listos para producción. La empresa también indica que hacen que hablar con Gemini en la app de Gemini, Google Workspace y Search sea más fluido y colaborativo, ayudando a los usuarios a abordar tareas complejas usando solo su voz.

Benchmarks y rendimiento

Gemini 3.8 Live Extended Thinking ofrece lo que Google describe como finalización de tareas e inteligencia de nivel empresarial, obteniendo el primer lugar general en el Speech to Speech Quality Index de Artificial Analysis con una puntuación de .6. El modelo lidera en finalización de tareas agénticas, con 68.6% en τ-Voice y35.1% en el benchmark τ-Voice-banking de Sierra. También ofrece sólidas capacidades de razonamiento, con una puntuación de 97.7% en Big Bench Audio, manteniendo un precio altamente competitivo en comparación con otros modelos de frontera.

Gemini 3.8 Live ha mostrado una alta preferencia entre los usuarios, asegurando el segundo lugar en el Speech Agent Arena. Además de ese resultado, Google señala que sigue siendo muy rentable, ofreciendo a desarrolladores y empresas un modelo capaz y eficiente diseñado para escalar.

En el EVA-Bench de ServiceNow, un benchmark para evaluar agentes de voz, Google indicó que sus modelos amplían la frontera de Pareto para flujos de trabajo complejos al equilibrar con éxito la precisión con la calidad conversacional. La empresa aclara que la evaluación se ejecutó en la Live API sobre la Gemini Enterprise Agent Platform.

Contexto visual, 97 idiomas y ejecución en segundo plano

Gemini 3.8 Live procesa entradas visuales en tiempo casi real, enriqueciendo las conversaciones con contexto para respuestas más útiles. Detecta y cambia automáticamente entre sus 97 idiomas compatibles a mitad de la conversación. El modelo también ejecuta herramientas y llamadas a API en segundo plano mientras la conversación continúa, lo que le permite reconocer las solicitudes y seguir conversando mientras las tareas terminan en segundo plano.

Las demostraciones en video publicadas con el anuncio muestran al modelo guiando la incorporación de empleados en tiempo real, usando contexto visual para responder preguntas en vivo y jugando ajedrez en tiempo casi real combinando contexto visual, razonamiento y flujo conversacional natural.

Razonar y hablar al mismo tiempo

Para tareas que requieren un razonamiento más profundo, Gemini 3.8 Live Extended Thinking razona y habla al mismo tiempo. Google indica que el modelo ofrece mayor inteligencia para flujos de trabajo complejos manteniendo un flujo conversacional ininterrumpido. Utiliza señales verbales tempranas, como "Déjame verificar eso…", para reconocer las solicitudes de manera natural, y proporciona narración de progreso en vivo para guiar a los usuarios a través de tareas en segundo plano de múltiples pasos a medida que avanzan.

Las demostraciones incluyen a Gemini 3.8 Live Extended Thinking transformando bocetos en bruto y retroalimentación por voz en tiempo casi real en componentes React funcionales, y coordinando reservas de múltiples pasos y llamadas a funciones asincrónicas sin interrumpir la conversación natural en vivo. Google también mostró a Gemini 3.8 Live creando planes de negocio completos y kits de herramientas de marketing personalizados sobre la marcha mediante lenguaje natural.

Integración con Google Workspace y Search

En Google Workspace y Search, los modelos Live están diseñados para ofrecer experiencias más intuitivas y colaborativas, especialmente al abordar las tareas más complejas. Gemini 3.8 Live Extended Thinking puede usarse en Google Workspace a través de Docs Live, Gmail Live y Keep Live. Search Live ofrece ayuda paso a paso para la resolución de problemas en tiempo real impulsada por Gemini 3.8 Live.

Ecosistema de voz para desarrolladores y empresas

Mediante la Gemini Live API, plataformas de desarrollo como Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel y Vision Agents permiten a los desarrolladores crear e implementar con facilidad interfaces de alto rendimiento basadas en voz. Estas plataformas gestion en segundo plano la compleja infraestructura de transmisión de medios en tiempo real, permitiendo a los desarrolladores enfocarse por completo en diseñar la experiencia del usuario.

Google añadió que se está asociando con empresas como Salesforce, Genspark y Lumeris, que se muestran entusiasmadas con 3.8 Live y 3.8 Live Extended Thinking, destacando su latencia, fluidez y capacidades de llamada a herramientas.

Marca de agua SynthID para transparencia

Todo el audio generado por los productos de IA de Google lleva una marca de agua con SynthID. La empresa señala que esta marca de agua imperceptible está integrada directamente en la salida de audio, garantizando que el contenido generado por IA siga siendo detectable para ayudar a prevenir la desinformación. Para conocer los detalles del enfoque de la empresa en materia de seguridad y responsabilidad, Google remite a los lectores a la ficha del modelo.

Disponibilidad

Ambos modelos comienzan a implementarse hoy, en canales para desarrolladores, empresas y consumidores.

Gemini 3.8 Live:

  • Para desarrolladores: en la API de Gemini y Google AI Studio.
  • Para empresas: en vista previa privada en Gemini Enterprise, y próximamente en Gemini Enterprise for Customer Experience.
  • Para todos: en Search Live.

Gemini 3.8 Live Extended Thinking:

  • Para desarrolladores: en la API de Gemini y Google AI Studio.
  • Para empresas: en vista previa privada en Gemini Enterprise, y próximamente en Gemini Enterprise for Customer Experience y para clientes empresariales de Google Workspace.
  • Para todos: en Gemini Live, para suscriptores de Google AI Pro y Ultra en Workspace en Docs, y para todos los suscriptores de Google AI en Gmail y Keep.

El anuncio completo, incluidas las demostraciones en video, está disponible en el blog de Google DeepMind.