Google DeepMind startet Gemini 3.8 Live und 3.8 Live Extended Thinking für natürliche Sprach-KI
Wichtige Erkenntnisse
- •Google DeepMind hat am 15. September 2026 Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking eingeführt und beschreibt sie als seine bislang fortschrittlichsten Live-Dialogmodelle.
- •Gemini 3.8 Live Extended Thinking belegte den Gesamtrang 1 auf Artificial Analysis' Speech to Speech Quality Index mit 68,6 % beim agentischen τ-Voice-Benchmark und 97,7 % bei Big Bench Audio.
- •Die Modelle verarbeiten visuelle Eingaben in nahezu Echtzeit, wechseln automatisch zwischen 97 unterstützten Sprachen mitten im Gespräch und führen Tools und API-Aufrufe im Hintergrund aus, während das Gespräch weiterläuft.
- •Gemini 3.8 Live ist auf Skalierung und Kosteneffizienz ausgelegt, während Extended Thinking für hochkomplexe Aufgaben mit gleichzeitigem Reasoning und Sprechen, einschließlich Live-Fortschrittsansage, konzipiert ist.
- •Beide Modelle sind ab heute über die Gemini API und Google AI Studio verfügbar, mit Enterprise- und Verbraucher-Rollouts über Gemini Enterprise, Google Workspace, Search Live und die Gemini App.

Google DeepMind hat am 15. September 2026 die Einführung von Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking angekündigt, die das Unternehmen als seine bislang fortschrittlichsten Live-Dialogmodelle beschreibt. Laut der Ankündigung bringen die beiden Modelle Fortschritte beim Near-Real-Time-Reasoning, um Sprachagenten wirksamer zu ermöglichen, mit wesentlichen Verbesserungen bei Intelligenz und parallelem Reasoning, die die Zusammenarbeit intuitiver machen und sie besser für die Ausführung komplexer Aufgaben per Sprache geeignet machen.
Der Beitrag wurde von Tom Ouyang, Principal Engineer, und Malini Jaganathan, Member of Technical Staff, im Namen des Gemini Audio Teams verfasst.
Google erklärte, das Ziel der Einführung sei es, Sprachinteraktionen natürlicher, flüssiger und intelligenter zu gestalten. Die neuen Modelle bewältigen komplexes Reasoning, visuellen Kontext in Echtzeit und die Ausführung von Aufgaben im Hintergrund, ohne das laufende Gespräch zu unterbrechen. Sie können Unterbrechungen verarbeiten, zwischen Sprachen wechseln und ihren Gedankengang während der Arbeit erläutern – ein Verhalten, das Google als Schritt in Richtung einer KI beschreibt, die sich wie ein echter Gesprächspartner anfühlt. Ob Nutzer ein komplexes Problem lösen oder einfach nur chatten, das Erlebnis sei so gestaltet, dass es sich anfühlt, als höre die KI zu und denke mit. Die Funktionen sind ab heute über die Gemini API, Google Workspace und die Gemini App verfügbar.
Die beiden Modelle zielen auf unterschiedliche Anwendungsfälle ab:
- Gemini 3.8 Live ist auf Skalierung und Kosteneffizienz ausgelegt und kombiniert Konversationsintelligenz mit flüssigem Dialog und visueller Verankerung.
- Gemini 3.8 Live Extended Thinking ist für hochkomplexe Aufgaben konzipiert, mit erhöhter Intelligenz und mehrstufigem Reasoning.
Für Entwickler und Unternehmen positioniert die Modelle als Bausteine für zuverlässige, produktionsreife Sprachagenten. Das Unternehmen sagt zudem, sie machten die Sprachsteuerung von Gemini in der Gemini App, Google Workspace und Search flüssiger und kollaborativer und helfen Nutzern, komplexe Aufgaben allein per Sprache zu bewältigen.
Benchmarks und Leistung
Gemini 3.8 Live Extended Thinking bietet laut Google Task-Abschluss und Intelligenz auf Enterprise-Niveau und sicherte sich den Gesamtrang 1 auf Artificial Analysis' Speech to Speech Quality Index mit einem Wert von 82,6. Das Modell führt beim agentischen Task-Abschluss mit 68,6 % bei τ-Voice und 35,1 % bei Sierras τ-Voice-banking-Benchmark. Es bietet zudem starke Reasoning-Fähigkeiten mit 97,7 % bei Big Bench Audio und bleibt dabei im Vergleich zu anderen Frontier-Modellen sehr preislich wettbewerbsfähig.
Gemini 3.8 Live erfreute sich bei Nutzern großer Beliebtheit und belegte den zweiten Platz in der Speech Agent Arena. Darüber hinaus bleibt es laut Google äußerst kosteneffizient und bietet Entwicklern und Unternehmen ein leistungsfähiges, effizientes Modell für den Einsatz bei Skalierung.
Auf ServiceNows EVA-Bench, einem Benchmark zur Bewertung von Sprachagenten, schoben Googles Modelle laut Unternehmen die Pareto-Frontier für komplexe Workflows, indem sie Genauigkeit erfolgreich mit Gesprächsqualität ausbalancieren. Das Unternehmen weist darauf hin, dass die Evaluierung auf der Live API der Gemini Enterprise Agent Platform durchgeführt wurde.
Visueller Kontext, 97 Sprachen und Hintergrundausführung
Gemini 3.8 Live verarbeitet visuelle Eingaben in nahezu Echtzeit und bereichert Gespräche mit Kontext für hilfreichere Antworten. Es erkennt automatisch Sprachwechsel und wechselt mitten im Gespräch zwischen den 97 unterstützten Sprachen. Das Modell führt zudem Tools und API-Aufrufe im Hintergrund aus, während das Gespräch weiterläuft, sodass es Anfragen bestätigen und weiter chatten kann, während Aufgaben im Hintergrund abgeschlossen werden.
In der Ankündigung veröffentlichte Videodemonstrationen zeigen das Modell, wie es die Onboarding von Mitarbeitern in Echtzeit begleitet, mit visuellem Kontext laufende Fragen beantwortet und in nahezu Echtzeit Schach spielt, indem es visuellen Kontext, Reasoning und natürlichen Gesprächsfluss kombiniert.\n## Reasoning und Sprechen gleichzeitig
Für Aufgaben, die tieferes Reasoning erfordern, denkt und spricht Gemini 3.8 Live Extended Thinking gleichzeitig. Google sagt, das Modell liefere erhöhte Intelligenz für komplexe Workflows und bewahre dabei einen unterbrechungsfreien Gesprächsfluss. Es nutzt frühe verbale Signale wie „Ich prüfe das kurz…“, um Eingaben auf natürliche Weise zu bestätigen, und bietet eine Live-Fortschrittsansage, die Nutzer durch mehrstufige Hintergrundaktionen begleitet, während diese fortschreiten.
Zu den Demonstrationen gehören Gemini 3.8 Live Extended Thinking, das Rohskizzen und Sprachfeedback in nahezu Echtzeit in funktionale React-Komponenten umwandelt, sowie die Koordination mehrstufiger Buchungen und asynchroner Funktionsaufrufe ohne Unterbrechung des natürlichen Live-Gesprächs. Google zeigte auch, wie Gemini 3.8 Live komplette Geschäftspläne und individuelle Marketing-Toolkits direkt per natürlicher Sprache erstellt.
Google Workspace- und Search-Integration
In Google Workspace und Search sollen die Live-Modelle intuitivere, kollaborativere Erlebnisse bieten, insbesondere bei den komplexesten Aufgaben. Gemini 3.8 Live Extended Thinking kann in Google Workspace über Docs Live, Gmail Live und Keep Live genutzt werden. Search Live bietet Schritt-für-Schritt-Hilfe zur Fehlerbehebung in Echtzeit, powered by Gemini 3.8 Live.
Sprach-Ökosystem für Entwickler und Unternehmen
Über die Gemini Live API ermöglichen Entwicklerplattformen wie Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel und Vision Agents Entwicklern, leistungsstarke, sprachgesteuerte Interfaces einfach zu entwickeln und bereitzustellen. Diese Plattformen verwalten komplexe Echtzeit-Media-Streaming-Infrastruktur im Hintergrund, sodass sich Entwickler vollständig auf die Gestaltung der Nutzererfahrung konzentrieren können.
Google ergänzte, dass man mit Unternehmen wie Salesforce, Genspark und Lumeris zusammenarbeite, die von 3.8 Live und 3.8 Live Extended Thinking begeistert seien und die beeindruckende Latenz, Flüssigkeit und Tool-Calling-Fähigkeiten der Modelle hervorheben.
Transparenz durch SynthID-Wasserzeichen
Alle von Googles KI-Produkten erzeugten Audiodateien sind mit SynthID versehen. Dieses nicht wahrnehmbare Wasserzeichen sei direkt in die Audiogabe eingewoben und stelle sicher, dass KI-generierte Inhalte erkennbar bleiben, um Fehlinformationen vorzubeugen. Details zum Ansatz in Sachen Sicherheit und Verantwortung finden Leser im Model Card.
Nutzung der neuesten Gemini Audio Modelle
Beide Modelle starten heute auf Entwickler-, Unternehmens- und Verbraucherplattformen.
Gemini 3.8 Live:
- Für Entwickler: in der Gemini API und Google AI Studio.
- Für Unternehmen: in privater Vorschau in Gemini Enterprise und bald in Gemini Enterprise for Customer Experience.
- Für alle: in Search Live.
Gemini 3.8 Live Extended Thinking:
- Für Entwickler: in der Gemini API und Google AI Studio.
- Für Unternehmen: in privater Vorschau in Gemini Enterprise und bald in Gemini Enterprise for Customer Experience sowie für Google Workspace Geschäftskunden.
- Für alle: in Gemini Live sowie für Google AI Pro- und Ultra-Abonnenten in Workspace in Docs und für alle Google AI-Abonnenten in Gmail und Keep.
Die vollständige Ankündigung einschließlich Videodemonstrationen ist im Google DeepMind Blog verfügbar.