ActualitésActionsGoogle lance les modèles audio Gemini 3.8 Live pour l'IA conversationnelle en temps réel

Google lance les modèles audio Gemini 3.8 Live pour l'IA conversationnelle en temps réel

Auteur: AI Business·

Points clés

  • Google a publié le 15 septembre Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking, des modèles audio conçus pour créer des agents vocaux capables de raisonner et d'exécuter des tâches pendant des conversations en direct.
  • Les modèles peuvent effectuer des appels d'API et d'outils tout en diffusant des réponses audio, accepter des entrées visuelles en direct et prendre en charge plus de 97 langues.
  • La version Extended Thinking inclut la réflexion configurable, une fonctionnalité permettant d'activer ou de désactiver le raisonnement interne du modèle.
  • L'architecture sépare la latence d'interaction de la latence de raisonnement, permettant aux agents de faire progresser la conversation pendant que le raisonnement se poursuit en arrière-plan plutôt que de suspendre l'interaction en attendant une réponse.
  • Les analystes estiment que Google rattrape des fournisseurs comme Apple tout en faisant progresser l'interaction IA en temps réel, avec des applications entreprises incluant les chatbots de support client, les processus de vente et les applications agentiques multimodales.
Google lance les modèles audio Gemini 3.8 Live pour l'IA conversationnelle en temps réel

Google a présenté deux nouveaux modèles audio permettant aux entreprises de déployer des agents d'IA intelligents avec un raisonnement plus approfondi, plus d'interactivité et une rapidité conversationnelle.

Lancés le 15 septembre, Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking permettent aux développeurs de créer des agents vocaux capables de raisonner et d'exécuter des tâches tout en maintenant le flux de la conversation, a indiqué Google. Les modèles prennent en charge l'interaction en temps réel sans le traditionnel schéma invite-réponse, permettant aux utilisateurs de converser naturellement plutôt que de formuler des invites distinctes.

Les capacités clés des modèles incluent l'exécution d'appels d'API et d'outils — les mécanismes par lesquels les agents se connectent à des systèmes externes et exécutent des tâches — tout en continuant de diffuser des réponses audio aux utilisateurs, l'acceptation d'entrées visuelles en direct qui aident les agents à comprendre à la fois ce que disent et ce que voient les utilisateurs, et la prise en charge de plus de 97 langues, une étendue pertinente pour les entreprises déployant des agents vocaux dans plusieurs régions. La version Extended Thinking ajoute la réflexion configurable, une fonctionnalité permettant d'activer ou de désactiver le raisonnement interne d'un modèle d'IA.

Cette sortie intervient deux semaines après l'introduction initiale par Google des modèles de fondation Gemini 3.8 Flash et 3.8 Cyber.

Avec les capacités de 3.8 Live, Google semble rattraper des fournisseurs comme Apple, qui propose déjà la transcription en temps réel dans des applications de productivité telles que Notes et Dictaphone, a déclaré Bradley Shimmin, analyste chez Futurum Group. Néanmoins, la technologie de Google va plus loin en changeant la manière dont les utilisateurs interagissent avec l'IA, a-t-il ajouté.

De vraies conversations

« La façon dont c'est architecturé … on peut personnaliser cela pour qu'il se comporte de nombreuses manières différentes », a déclaré Shimmin. Il a noté que si les entreprises peuvent utiliser ces modèles pour des cas d'usage de traduction classiques, Google les a également conçus pour que les utilisateurs n'interagissent pas selon un schéma invite-réponse ; ils peuvent plutôt tenir une véritable conversation.

« C'est simplement une conversation naturelle, avec la possibilité de l'interrompre en temps réel pour injecter », a déclaré Shimmin. « On peut injecter du contexte dans la conversation sans interrompre ce qu'il est en train de faire. »

Grâce à la technologie avancée de reconnaissance vocale de Google, les nouveaux modèles ne se contentent pas de à une question au premier degré, a expliqué Sid Nag, fondateur de Tekonyx.

« Le modèle est conçu pour effectuer un raisonnement en arrière-plan », a déclaré Nag. « Il le fait pendant la conversation, ce qui permet de maintenir la conversation active pendant qu'il raisonne. »

Cette technologie constitue une avancée dans laquelle la latence d'interaction — le délai entre l'action d'un utilisateur et la réponse du système — est séparée de la latence de raisonnement, le temps total nécessaire à un modèle d'IA pour traiter l'information. C'est cette séparation qui permet à un agent de faire progresser la conversation pendant que le raisonnement se poursuit en arrière-plan, plutôt que de suspendre l'interaction jusqu'à ce qu'une réponse soit prête.

« Il le fait en temps réel, plutôt que de s'arrêter puis de revenir avec une autre réponse », a déclaré Nag.

Les modèles vocaux modifient également la manière dont un agent d'IA répond et interagit, car « un agent d'IA n'est pas forcément obligé de choisir entre être rapide et être réfléchi », a poursuivi Nag. « Il peut réellement maintenir une interaction en temps réel. »

Les applications entreprises de ces nouveaux modèles incluent les chatbots de support client, les processus de vente et les applications agentiques multimodales combinant texte, voix et vidéo, a indiqué Nag. Les applications agentiques sont des logiciels dans lesquels les agents d'IA raisonnent et exécutent des tâches plutôt que de simplement répondre à des invites — un mode de fonctionnement qui repose sur l'appel d'outils en cours de conversation et le raisonnement en arrière-plan du type de ceux qu'offrent les nouveaux modèles.

Rédaction : Esther Shittu, AI Business. Reportage original : Gemini 3.8 Live Transforms Conversational AI, publié le 17 septembre 2026.