Google startet Gemini 3.8 Live Audio-Modelle für Echtzeit-Konversations-KI
Wichtige Erkenntnisse
- •Google hat am 15. September Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking veröffentlicht – Audio-Modelle für den Aufbau von Sprach-Agenten, die während laufender Gesprächen reasoning betreiben und Aufgaben ausführen.
- •Die Modelle können API- und Tool-Aufrufe ausführen, während Audio-Antworten gestreamt werden, akzeptieren Live-Visuelleingaben und unterstützen mehr als 97 Sprachen.
- •Die Version Extended Thinking umfasst konfigurierbares Denken, eine Funktion, mit der Nutzer das interne Reasoning eines Modells ein- oder ausschalten können.
- •Die Architektur trennt interaktive Latenz von Reasoning-Latenz, sodass Agenten ein Gespräch in Bewegung halten können, während das Reasoning im Hintergrund weiterläuft, statt auf eine Antwort zu warten.
- •Analysten sehen Google auf dem Weg, zu Anbietern wie Apple aufzuschließen und gleichzeitig die Echtzeit-KI-Interaktion voranzutreiben; Unternehmensanwendungen umfassen Kundensupport-Chatbots, Vertriebsprozesse und multimodale agentische Anwendungen.

Google hat zwei neue Audio-Modelle vorgestellt, mit denen Unternehmen intelligente KI-Agenten mit tieferem Reasoning, mehr Interaktivität und Konversationsgeschwindigkeit einsetzen können.
Die am 15. September gestarteten Modelle Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking ermöglichen Entwicklern den Aufbau von Sprach-Agenten, die reasoning betreiben und Aufgaben ausführen können, während der Gesprächsfluss erhalten bleibt, so Google. Die Modelle unterstützen Echtzeit-Interaktion ohne die klassische Prompt-Response-Struktur, sodass Nutzer natürlich sprechen können, statt einzelne Prompts zu formulieren.
Zu den wichtigsten Fähigkeiten der Modelle gehören das Ausführen von API- und Tool-Aufrufen – den Mechanismen, mit denen Agenten externe Systeme anbinden und Aufgaben ausführen – während weiterhin Audio-Antworten an die Nutzer gestreamt werden, die Annahme von Live-Visuelleingaben, die Agenten helfen zu verstehen, was Nutzer sagen und sehen, sowie Unterstützung für mehr als 97 Sprachen – ein Umfang, der für Unternehmen relevant ist, die Sprach-Agenten über Regionen hinweg einsetzen. Die Version Extended Thinking ergänzt konfigurierbares Denken, eine Funktion, mit der Nutzer das interne Reasoning eines KI-Modells ein- oder ausschalten können.
Der Release kommt zwei Wochen, nachdem Google zunächst die Foundation-Modelle Gemini 3.8 Flash und 3.8 Cyber eingeführt hatte.
Mit den Fähigkeiten von 3.8 Live scheint Google zu Anbietern wie Apple aufzuschließen, die bereits Echtzeit-Transkription in Produktivitäts-Apps wie Notes und Voice Memos anbieten, sagte Bradley Shimmin, Analyst bei der Futurum Group. Dennoch hebe Googles Technologie das Ganze auf eine neue Ebene, indem sie verändert, wie Nutzer mit KI interagieren, so Shimmin.
Echte Gespräche
"So, wie es aufgebaut ist … kann man das an viele verschiedene Verhaltensweisen anpassen", sagte Shimmin. Er wies darauf hin, dass Unternehmen die Modelle zwar für klassische Übersetzungsanwendungen nutzen können, Google sie aber auch so konzipiert hat, dass Nutzer nicht im Prompt-Response-Muster interagieren; vielmehr können sie ein echtes Gespräch führen.
"Es ist einfach ein natürliches Gespräch mit der Möglichkeit, es in Echtzeit zu unterbrechen, um etwas einzuspeisen", sagte Shimmin. "Man kann Kontext in das Gespräch einspeisen, ohne zu unterbrechen, was es gerade tut."
Mit Googles fortschrittlicher Sprachtechnologie beantworten die neuen Modelle eine Frage nicht nur oberflächlich, sagte Sid Nag, Gründer von Tekonyx.
"Das Modell ist darauf ausgelegt, im Hintergrund zu betreiben", sagte Nag. "Es macht das während des Gesprächs, sodass das Gespräch am Leben bleibt, während das Modell reasoning betreibt."
Bei dieser Weiterentwicklung wird die interaktive Latenz – die Verzögerung zwischen einer Nutzeraktion und der Systemreaktion – von der Reasoning-Latenz getrennt, der Gesamtzeit, die ein KI-Modell zur Verarbeitung von Informationen benötigt. Diese Trennung ermöglicht es einem Agenten, ein Gespräch am Laufen zu halten, während das Reasoning im Hintergrund weiterläuft, statt die Interaktion anzuhalten, bis eine Antwort bereitsteht.
"Es passiert in Echtzeit, statt anzuhalten und dann mit einer anderen Antwort zurückzukommen", sagte Nag.
Die Sprachmodelle verändern auch, wie ein KI-Agent reagiert und interagiert, denn "ein KI-Agent muss nicht zwingend zwischen Schnelligkeit und Nachdenklichkeit wählen", fuhr Nag fort. "Es kann tatsächlich eine Echtzeit-Interaktion aufrechterhalten."
Zu den Unternehmensanwendungen für die neuen Modelle gehören Chatbots für den Kundensupport, Vertriebsprozesse und multimodale agentische Anwendungen, die Text, Sprache und Video kombinieren, sagte Nag. Agentische Anwendungen sind Software, in der KI-Agenten reasoning betreiben und Aufgaben ausführen, statt lediglich auf Prompts zu antworten – ein Muster, das auf Tool-Aufrufen mitten im Gespräch und Hintergrund-Reasoning der Art beruht, wie die neuen Modelle sie bieten.
Bericht von Esther Shittu, AI Business. Originalbericht: Gemini 3.8 Live Transforms Conversational AI, veröffentlicht am 17. September 2026.