NieuwsAandelenGoogle lanceert Gemini 3.8 Live-audiomodellen voor realtime conversationele AI

Google lanceert Gemini 3.8 Live-audiomodellen voor realtime conversationele AI

Auteur: AI Business·

Belangrijkste punten

  • Google bracht op 15 september Gemini 3.8 Live en Gemini 3.8 Live Extended Thinking uit, audiomodellen ontworpen voor het bouwen van spraakagents die redeneren en taken uitvoeren tijdens live gesprekken.
  • De modellen kunnen API- en toolcalls uitvoeren tijdens het streamen van audioreacties, accepteren live visuele invoer en ondersteunen meer dan 97 talen.
  • De versie Extended Thinking bevat configureerbaar denken, een functie waarmee gebruikers het interne redeneren van een model aan of uit kunnen zetten.
  • De architectuur scheidt interactieve latentie van redeneerlatentie, waardoor agents een gesprek doorlopend kunnen houden terwijl het redeneren op de achtergrond doorgaat in plaats van te pauzeren voor een antwoord.
  • Analisten zien Google marktleiders zoals Apple inhalen en realtime AI-interie verder brengen, met bedrijfstoepassingen zoals chatbots voor klantondersteuning, verkoopprocessen en multimodale agentische toepassingen.
Google lanceert Gemini 3.8 Live-audiomodellen voor realtime conversationele AI

Google heeft twee nieuwe audiomodellen geïntroduceerd waarmee ondernemingen intelligente AI-agents kunnen inzetten met dieper redeneren, meer interactiviteit en conversationele snelheid.

Gemini 3.8 Live en Gemini 3.8 Live Extended Thinking, gelanceerd op 15 september, laten ontwikkelaars spraakagents bouwen die kunnen redeneren en taken uitvoeren terwijl de flow van het gesprek behouden blijft, aldus Google. De modellen ondersteunen realtime interactie zonder de traditionele prompt-responsestructuur, waardoor gebruikers natuurlijk kunnen converseren in plaats van losse prompts te geven.

De belangrijkste mogelijkheden van de modellen omvatten het uitvoeren van API- en toolcalls — de mechanismen waarmee agents verbinding maken met externe systemen en taken uitvoeren — terwijl audioreacties naar gebruikers worden gestreamd, het accepteren van live visuele invoer die agents helpt begrijpen wat gebruikers zeggen én zien, en ondersteuning voor meer dan 97 talen, een reikwijdte die relevant is voor ondernemingen die spraakagents in meerdere regio's inzetten. De versie Extended Thinking voegt configureerbaar denken toe, een functie waarmee gebruikers het interne redeneren van een AI-model aan of uit kunnen zetten.

De release volgt twee weken nadat Google aanvankelijk de Gemini 3.8 Flash- en 3.8 Cyber-basismodellen introduceerde.

Met de mogelijkheden van 3.8 Live lijkt Google in te halen op leveranciers zoals Apple, dat al realtime transcriptie biedt in productiviteitsapps zoals Notes en Voice Memos, zei Bradley Shimmin, analist bij Futurum Group. Toch tilt Google's technologie het naar een hoger niveau door te veranderen hoe gebruikers met AI omgaan, aldus Shimmin.

Echte gesprekken

"De manier waarop het is opgebouwd … je kunt dit aanpassen zodat het zich op veel verschillende manieren gedraagt", zei Shimmin. Hij merkte op datewel ondernemingen de modellen kunnen gebruiken voor traditionele vertaaltoepassingen, Google ze ook zo heeft ontworpen dat gebruikers niet op een prompt-responsemanier interageren; in plaats daarvan kunnen ze een echt gesprek voeren.

"Het is gewoon een natuurlijk gesprek met de mogelijkheid om het in realtime te onderbreken om iets in te brengen", zei Shimmin. "Je kunt context in het gesprek brengen zonder te onderbreken wat het aan het doen is."

Met Google's geavanceerde spraaktechnologie beantwoorden de nieuwe modellen een vraag niet alleen oppervlakkig, zei Sid Nag, oprichter van Tekonyx.

"Het model is ontworpen om op de achtergrond te redeneren", zei Nag. "Het doet dat tijdens het gesprek, zodat je het gesprek gaande kunt houden terwijl het redeneert."

De technologie is een vooruitgang waarbij interactieve latentie — de vertraging tussen het uitvoeren van een actie door een gebruiker en het reageren van het systeem — wordt gescheiden van redeneerlatentie, de totale tijd die een AI-model nodig heeft om informatie te verwerken. Die scheiding maakt het mogelijk dat een agent een gesprek doorlopend houdt terwijl het redeneren op de achtergrond doorgaat, in plaats van de interactie te pauzeren tot een antwoord gereed is.

"Het gebeurt in realtime, in plaats van te stoppen en dan met een ander antwoord terug te komen", zei Nag.

De spraakmodellen veranderen ook hoe een AI-agent reageert en interageert, omdat "een AI-agent niet per se hoeft te kiezen tussen snel en doordacht zijn", vervolgde Nag. "Het kan daadwerkelijk een realtime interactie onderhouden."

Bedrijfstoepassingen voor de nieuwe modellen omvatten chatbots voor klantondersteuning, verkoopprocessen en multimodale agentische toepassingen die tekst, stem en video combineren, zei Nag. Agentische toepassingen zijn software waarin AI-agents redeneren en taken uitvoeren in plaats van alleen op prompts te reageren — een patroon dat leunt op toolcalls middenin het gesprek en achtergrondredenering van het soort dat de nieuwe modellen bieden.

Reportage door Esther Shittu, AI Business. Origineel bericht: Gemini 3.8 Live Transforms Conversational AI, gepubliceerd op 17 september 2026.