Google DeepMind lance Gemini 3.8 Live et 3.8 Live Extended Thinking pour une IA vocale plus naturelle
Points clés
- •Google DeepMind a lancé Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking le 15 septembre 2026, les présentant comme ses modèles de dialogue en direct les plus avancés à ce jour.
- •Gemini 3.8 Live Extended Thinking s classé premier au Speech to Speech Quality Index d'Artificial Analysis, avec 68,6 % au benchmark agentique τ-Voice et 97,7 % sur Big Bench Audio.
- •Les modèles traitent les entrées visuelles en quasi temps réel, basculent automatiquement parmi 97 langues prises en charge en cours de conversation et exécutent des outils et des appels d'API en arrière-plan pendant que les conversations se poursuivent.
- •Gemini 3.8 Live est positionné pour l'échelle et l'efficacité des coûts, tandis qu'Extended Thinking est conçu pour les tâches très complexes avec raisonnement et parole simultanés, incluant une narration en direct de la progression.
- •Les deux modèles sont disponibles dès aujourd'hui via l'API Gemini et Google AI Studio, avec des déploiements pour entreprises et grand public sur Gemini Enterprise, Google Workspace, Search Live et l'application Gemini.

Google DeepMind a annoncé le 15 septembre 2026 le lancement de Gemini 3.8 Live et de Gemini 3.8 Live Extended Thinking, décrits par l'entreprise comme ses modèles de dialogue en direct les plus avancés à ce jour. Selon l'annonce, les deux modèles apportent des avancées en matière de raisonnement en quasi temps réel pour permettre plus efficacement les agents vocaux, avec d'importantes améliorations d'intelligence et de raisonnement parallèle qui les rendent plus intuitifs à utiliser en collaboration et mieux adaptés à l'exécution de tâches complexes à la voix.
L'article a été rédigé par Tom Ouyang, ingénieur principal, et Malini Jaganathan, membre du personnel technique, au nom de l'équipe Gemini Audio.
Google a indiqué que ce lancement vise à rendre les interactions vocales plus naturelles, fluides et intelligentes. Les nouveaux modèles gèrent le raisonnement complexe, le contexte visuel en temps réel et l'exécution de tâches en arrière-plan sans interrompre la conversation en cours. Ils peuvent gérer les interruptions, passer d'une langue à l'autre et expliquer leur processus de réflexion pendant qu'ils travaillent — un comportement que Google présente comme un pas vers une IA ressemblant à un véritable partenaire de conversation. Que les utilisateurs résolvent un problème complexe ou discutent simplement, l'entreprise affirme que l'expérience est conçue pour donner l'impression que l'IA les écoute et réfléchit avec eux. Ces fonctionnalités sont disponibles dès aujourd'hui via l'API Gemini, Google Workspace et l'application Gemini.
Les deux modèles ciblent des cas d'usage distincts :
- Gemini 3.8 Live est conçu pour l'échelle et l'efficacité des coûts, associant intelligence conversationnelle, dialogue fluide et ancrage visuel.
- Gemini 3.8 Live Extended Thinking est conçu pour les tâches très complexes, avec une intelligence accrue et un raisonnement en plusieurs étapes.
Pour les développeurs et les entreprises, Google positionne ces modèles comme les éléments de base d'agents vocaux fiables et prêts pour la production. L'entreprise indique également qu'ils rendent les échanges vocaux avec Gemini plus fluides et plus collaboratifs dans l'application Gemini Google Workspace et Search, aidant les utilisateurs à accomplir des tâches complexes rien qu'avec leur voix.
Benchmarks et performances
Gemini 3.8 Live Extended Thinking offre ce que Google décrit comme une exécution de tâches et une intelligence de niveau entreprise, décrochant la première place du Speech to Speech Quality Index d'Artificial Analysis avec un score de .6. Le modèle domine l'exécution de tâches agentiques, avec 68,6 % sur τ-Voice et 35,1 % sur le benchmark τ-Voice-banking de Sierra. Il offre également de solides capacités de raisonnement, avec un score de 97,7 % sur Big Bench Audio, tout en maintenant un tarif très compétitif par rapport aux autres modèles de pointe.
Gemini 3.8 Live a montré une forte préférence parmi les utilisateurs, se classant deuxième au Speech Agent Arena. Au-delà de ce résultat, Google indique qu'il demeure très rentable, offrant aux développeurs et aux entreprises un modèle performant et efficace conçu pour l'échelle.
Sur l'EVA-Bench de ServiceNow, un benchmark d'évaluation des agents vocaux, Google a déclaré que ses modèles repoussent la frontière de Pareto pour les flux de travail complexes en équilibrant avec succès précision et qualité conversationnelle. L'entreprise précise que l'évaluation a été menée sur l'API Live de la Gemini Enterprise Agent Platform.
Contexte visuel, 97 langues et exécution en arrière-plan
Gemini 3.8 Live traite les entrées visuelles en quasi temps réel, enrichissant les conversations de contexte pour des réponses plus utiles. Il détecte automatiquement les langues parmi les 97 prises en charge et bascule entre elles en cours de conversation. Le modèle exécute également des outils et des appels d'API en arrière-plan pendant que la conversation se poursuit, ce qui lui permet d'accuser réception des demandes et de continuer à discuter pendant que les tâches s'achèvent en coulisses.
Les démonstrations vidéo publiées avec l'annonce montrent le modèle accompagnant l'intégration d'employés en temps réel, utilisant le contexte visuel pour répondre à des questions en direct, et jouant aux échecs en quasi temps réel en combinant contexte visuel, raisonnement et fluidité conversationnelle naturelle.
Raisonner et parler simultanément
Pour les tâches nécessitant un raisonnement plus approfondi, Gemini 3.8 Live Extended Thinking raisonne et parle en même temps. Selon Google, le modèle offre une intelligence accrue pour les flux de travail complexes tout en maintenant un flux conversationnel ininterrompu. Il utilise des indices verbaux précoces, comme « Laissez-moi vérifier cela… », pour accuser réception naturellement des demandes, et fournit une narration en direct de la progression pour guider les utilisateurs à travers les tâches en arrière-plan en plusieurs étapes au fur et à mesure de leur avancement.
Les démonstrations incluent Gemini 3.8 Live Extended Thinking transformant des croquis bruts et des retours vocaux en quasi temps réel en composants React fonctionnels, et coordonn des réservations en plusieurs étapes et des appels de fonctions asynchrones sans interrompre la conversation naturelle en direct. Google a également montré Gemini 3.8 Live élaborant à la volée des plans d'affaires complets et des kits d'outils marketing personnalisés par la seule parole naturelle.
Intégration à Google Workspace et Search
Dans Google Workspace et Search, les modèles Live sont conçus pour offrir des expériences plus intuitives et collaboratives, en particulier pour les tâches les plus complexes. Gemini 3.8 Live Extended Thinking est utilisable dans Google Workspace via Docs Live, Gmail Live et Keep Live. Search Live propose une aide au dépannage pas à pas en temps réel propulsée par Gemini 3.8 Live.
Un écosystème vocal pour les développeurs et les entreprises
Grâce à l'API Gemini Live, des plateformes de développement comme Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel et Vision Agents permettent aux développeurs de créer et déployer facilement des interfaces vocales performantes. Ces plateformes gèrent en coulisses la complexité de l'infrastructure de streaming multimédia en temps réel, permettant aux développeurs de se concentrer entièrement sur la conception de l'expérience utilisateur.
Google ajoute qu'il collabore avec des entreprises telles que Salesforce, Genspark et Lumeris, qui se disent enthousiastes à propos de 3.8 Live et 3.8 Live Extended Thinking, soulignant leur latence, leur fluidité et leurs capacités d'appel d'outils remarquables.
Transparence grâce au filigrane SynthID
Tout l'audio généré par les produits d'IA de Google est filigrané avec SynthID. L'entreprise indique que ce filigrane imperceptible est directement intégré à la sortie audio, garantissant que les contenus générés par l'IA restent détectables afin de contribuer à prévenir la désinformation. Pour plus de détails sur l'approche de l'entreprise en matière de sécurité et de responsabilité, Google renvoie les lecteurs vers la fiche modèle.
Disponibilité
Les deux modèles commencent leur déploiement aujourd'hui, sur les offres destinées aux développeurs, aux entreprises et au grand public.
Gemini 3.8 Live :
- Pour les développeurs : dans l'API Gemini et Google AI Studio.
- Pour les entreprises : en préversion privée dans Gemini Enterprise, et bientôt dans Gemini Enterprise for Customer Experience.
- Pour tous : dans Search Live.
Gemini 3.8 Live Extended Thinking :
- Pour les développeurs : dans l'API Gemini et Google AI Studio.
- Pour les entreprises : en préversion privée dans Gemini Enterprise, et bientôt dans Gemini Enterprise for Customer Experience et pour les clients professionnels de Google Workspace.
- Pour tous : dans Gemini Live, pour les abonnés Google AI Pro et Ultra dans Workspace dans Docs, et pour tous les abonnés Google AI dans Gmail et Keep.
L'annonce complète, avec les démonstrations vidéo, est disponible sur le blog Google DeepMind.