NoticiasAccionesGoogle lanza los modelos de audio Gemini 3.8 Live para IA conversacional en tiempo real

Google lanza los modelos de audio Gemini 3.8 Live para IA conversacional en tiempo real

Autor: AI Business·

Puntos clave

  • Google lanzó el 15 de septiembre Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, modelos de audio diseñados para construir agentes de voz que razonan y ejecutan tareas durante conversaciones en vivo.
  • Los modelos pueden realizar llamadas a API y herramientas mientras transmiten respuestas de audio, aceptan entradas visuales en vivo y admiten más de 97 idiomas.
  • La versión Extended Thinking incluye pensamiento configurable, una función que permite a los usuarios activar o desactivar el razonamiento interno del modelo.
  • La arquitectura separa la latencia interactiva de la latencia de razonamiento, lo que permite a los agentes mantener el flujo de la conversación mientras el razonamiento en segundo plano continúa, en lugar de pausar la interacción hasta obtener una respuesta.
  • Los analistas consideran que Google está alcanzando a proveedores como Apple mientras avanza en la interacción con la IA en tiempo real, con aplicaciones empresariales que incluyen chatbots de atención al cliente, procesos de ventas y aplicaciones agénticas multimodales.
Google lanza los modelos de audio Gemini 3.8 Live para IA conversacional en tiempo real

Google ha presentado dos nuevos modelos de audio que permiten a las empresas desplegar agentes de IA inteligentes con mayor capacidad de razonamiento, más interactividad y velocidad conversacional.

Lanzados el 15 de septiembre, Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking permiten a los desarrolladores construir agentes de voz que pueden razonar y ejecutar tareas manteniendo el flujo de la conversación, según Google. Los modelos admiten interacción en tiempo real sin la estructura tradicional de prompt y respuesta, lo que permite a los usuarios conversar de forma natural en lugar de emitir prompts discretos.

Las capacidades clave de los modelos incluyen realizar llamadas a API y herramientas —los mecanismos que los agentes usan para conectarse con sistemas externos y ejecutar tareas— mientras continúan transmitiendo respuestas de audio a los usuarios, aceptar entradas visuales en vivo que ayudan a los agentes a comprender tanto lo que los usuarios dicen como lo que ven, y admitir más de 97 idiomas, un rango relevante para las empresas que despliegan agentes de voz en distintas regiones. La versión Extended Thinking añade el pensamiento configurable, una función que permite a los usuarios activar o desactivar el razonamiento interno de un modelo de IA.

El lanzamiento llega dos semanas después de que Google presentara inicialmente los modelos fundacionales Gemini 3.8 Flash y 3.8 Cyber.

Con las capacidades de 3.8 Live, Google parece estar alcanzando a proveedores como Apple, que ya ofrece transcripción en tiempo real en aplicaciones de productividad como Notes y Voice Memos, dijo Bradley Shimmin, analista de Futurum Group. Aun así, la tecnología de Google lleva esto al siguiente nivel al cambiar la forma en que los usuarios interactúan con la IA, señaló.

Conversaciones reales

"Por la forma en que está arquitectado … puedes personalizarlo para que se comporte de muchas maneras diferentes", dijo Shimmin. Señaló que, si bien las empresas pueden usar los modelos para casos de uso de traducción tradicionales, Google también los diseñó para que los usuarios no interactúen mediante prompts y respuestas; más bien, pueden mantener una conversación real.

"Es simplemente una conversación natural con la posibilidad de interrumpirla en tiempo real para introducir información", dijo Shimmin. "Puedes inyectar contexto en la conversación sin interrumpir lo que está haciendo".

Con la tecnología avanzada de voz de Google, los nuevos modelos no solo responden una pregunta a nivel superficial, dijo Sid Nag, fundador de Tekonyx.

"El modelo está diseñado para hacer razonamiento en segundo plano", dijo Nag. "Lo hace durante la conversación, de modo que puedes mantener la conversación activa mientras razona".

La tecnología representa un avance en el que la latencia interactiva —el retraso entre la acción de un usuario y la respuesta del sistema— se separa de la latencia de razonamiento, el tiempo total que le toma a un modelo de IA procesar la información. Esa separación es lo que permite a un agente mantener el flujo de la conversación mientras el razonamiento continúa en segundo plano, en lugar de pausar la interacción hasta que la respuesta esté lista.

"Lo hace en tiempo real, en lugar de detenerse y luego regresar con otra respuesta", dijo Nag.

Los modelos de voz también cambian la forma en que un agente de IA responde e interactúa, porque "un agente de IA no necesariamente tiene que elegir entre ser rápido y ser reflexivo", continuó Nag. "En realidad puede mantener una interacción en tiempo real".

Las aplicaciones empresariales de los nuevos modelos incluyen chatbots de atención al cliente, procesos de ventas y aplicaciones agénticas multimodales que combinan texto, voz y video, dijo Nag. Las aplicaciones agénticas son software en el que los agentes de IA razonan y ejecutan tareas lugar de simplemente responder a prompts, un patrón que depende de llamadas a herramientas a mitad de la conversación y del razonamiento en segundo plano del tipo que ofrecen los nuevos modelos.

Reportaje de Esther Shittu, AI Business. Reportaje original: Gemini 3.8 Live Transforms Conversational AI, publicado el 17 de septiembre de 2026.