Google DeepMind introduceert Gemini 3.8 Live met Live Avatar
Belangrijkste punten
- •Live Avatar stelt zakelijke agents in staat om in bijna realtime te luisteren, te kijken en te reageren via gesynchroniseerde audio en video.
- •Het systeem kan tools uitvoeren en informatie ophalen op de achtergrond zonder een actief gesprek te onderbreken.
- •Live Avatarsteunt meertalige spraak-naar-spraaksynchronisatie in 97 talen, waaronder het wisselen van taal tijdens een gesprek.
- •Organisaties kunnen voorgedefinieerde avatars kiezen, terwijl het maken van aangepaste avatars op basis van referentiebeelden beperkt is tot allowlisted ondernemingen.
- •SynthID-watermerken zijn ingebed in gegenereerde audio en video om door AI geproduceerde content te helpen identificeren.

Google DeepMind introduceerde Gemini 3.8 Live met Live Avatar op 24 september 2026 en voegde daarmee bijna realtime visuele aanwezigheid toe aan de conversationele AI. De functie combineert de native live-dialogmogelijkheden van Gemini met low-latency streamingvideo om natuurlijkere en intuïtievere interacties te creëren voor ondernemingen en hun gebruikers.
De aankondiging is geschreven door Shuo-yiin Chang, research scientist, en CJ Zheng, software engineer, namens het Gemini Audio Team. Hij volgde op de lancering van Gemini 3.8 Live vorige week.
Volgens Google DeepMind combineert Live Avatar bijna realtime videogeneratie met spraak, zodat het systeem kan luisteren, kijken en spreken via een dynamische visuele persona. De functie is ontworpen met nauwkeurige lipsynchronisatie, natuurlijke gezichtsuitdrukkingen en vlot spreken-op-beurten, waardoor virtuele diensten interactiever kunnen worden. Door het bedrijf genoemde mogelijke toepassingen zijn klantenservice en interactieve walkthroughs.
Gemini 3.8 Live met Live Avatar is vanaf vandaag beschikbaar in Gemini Enterprise. De oorspronkelijke aankondiging is te vinden op de Google DeepMind Blog.
Multimod gesprekken
Volgens Google DeepMind is een gesprek inherent multimodaal en omvat het luisteren, visuele aandacht, spraak en gezichtsuitdrukkingen. Live Avatar brengt deze mogelijkheden naar zakelijke agents door visuele en audio-invoer tegelijkertijd te verwerken en antwoorden te genereren die expressieve audio en video combineren.
Het bedrijf presenteerde de functie als in staat om in bijna realtime op te nemen wat het ziet en hoort, en vervolgens via audio en video te antwoorden voor natuurlijkere gesprekken. Voor de door Google DeepMind genoemde scenario's van klantenservice en interactieve walkthroughs is het praktische effect een virtuele agent die reageert op wat wordt getoond en in één gesprek antwoordt met stem en gezichtssignalen.
Tooluitvoering op de achtergrond
Live Avatar maakt ook gebruik van de redeneercapaciteiten van Gemini en asynchrone tool calls. Het kan tool calls starten en gegevens op de achtergrond ophalen terwijl een actief gesprek doorgaat. Zo kan het complexe taken afhandelen zonder het dialoog te onderbreken.
Google DeepMind gaf het inchecken van een gast in een hotel als voorbeeld van een taak waarbij tools op de achtergrond kunnen draaien terwijl het gesprek doorgaat. Voor ondernemingen ligt de waarde in continuïteit: klanten ervaren een ononderbroken gesprek terwijl het ophalen van gegevens en taakuitvoering onzichtbaar plaatsvinden.
Ondersteuning voor 97 talen
De functie omvat native meertalige spraak-naar-spraaksynchronisatie. Volgens Google DeepMind kan Live Avatar zijn lipsynchronisatie en gezichtsuitdrukkingen dynamisch aanpassen tijdens het wisselen tussen 97 talen, zonder verlies van videokwaliteit of visueel drift.
Het bedrijf demonstreerde ook het wisselen van taal midden in een gesprek, waarbij de lipsynchronisatie en expressies van de avatar zich tussen talen aanen. Voor bedrijven die gebruikers in verschillende regio's bedienen, spreekt die dekking — en de mogelijkheid om van taal te wisselen zonder visuele artefacten — rechtstreeks tot wereldwijde klantinteracties.
Aanpasbare avatars
Organisaties kunnen kiezen uit een bibliotheek met voorgedefinieerde avatars met verschillende uiterlijken, stemmen en expressieve stijlen. Ze kunnen Live Avatars ook aanpassen om een merk- of karakteridentiteit weer te geven.
Op basis van een referentiebeeld van hoge kwaliteit kunnen ontwikkelaars een volledig geanimeerde en responsieve avatar genereren, waarbij de gelijkenis van de referentie, de merkstijl of de karakteridentiteit behouden blijft. Volgens Google DeepMind is het maken van aangepaste avatars momenteel alleen beschikbaar via enterprise-allowlisting, waardoor de voorgedefinieerde bibliotheek de optie blijft voor organisaties buiten die lijst.
Watermerken en veiligheid
Volgens Google DeepMind bevat Live Avatar waarborgen die zijn bedoeld om identiteit te respecteren en door AI gegenereerde content transparant te houden. Uitvoer van de AI-producten van het bedrijf wordt van een watermerk voorzien met SynthID, een onwaarneembaar watermerk dat direct in audio en video is verwerkt.
Het bedrijf zei dat het watermerk helpt om door AI gegenereerde content detecteerbaar te houden en bedoeld is om desinformatie en verkeerde toeschrijving te minimaliseren. Voor ondernemingen die expressieve videopersona's aan klanten tonen, zorgt het watermerk ervoor dat door AI gegenereerde interacties als synthetisch identificeerbaar blijven. Meer informatie over de aanpak van het bedrijf op het gebied van veiligheid en verantwoorde inzet is te vinden in de model card.
Gemini 3.8 Live met Live Avatar is beschikbaar in Gemini Enterprise. Google DeepMind verwees ontwikkelaars ook naar de API-documentatie om te beginnen. Voor teams die merk-specifieke avatars willen naast de voorgedefinieerde bibliotheek, is de enterprise-allowlist voor het maken van aangepaste avatars het toegangsdetail om in de gaten te houden.