AktualnościAkcjeGoogle DeepMind zaprezentował Gemini 3.8 Live z Live Avatar

Google DeepMind zaprezentował Gemini 3.8 Live z Live Avatar

Autor: Google DeepMind Blog·

Najważniejsze informacje

  • •Live Avatar umożliwia agentom enterprise słuchanie, widzenie i odpowiadanie za pomocą zsynchronizowanego audio i wideo niemal w czasie rzeczywistym.
  • •System może wykonywać narzędzia i pobierać informacje w tle bez przerywania aktywnej rozmowy.
  • •Live Avatar obsługuje wielojęzyczną synchronizację mowa-do-mowy w 97 językach, w tym zmianę języka w trakcie rozmowy.
  • •Organizacje mogą wybierać gotowe awatary, natomiast tworzenie niestandardowych awatarów z obrazów referencyjnych jest ograniczone do zapisanych na listę przedsiębiorstw.
  • •Znakowanie wodne SynthID jest osadzone w generowanym audio i wideo, aby pomagać identyfikować treści stworzone przez AI.
Google DeepMind zaprezentował Gemini 3.8 Live z Live Avatar

Google DeepMind zaprezentował Gemini 3.8 Live z Live Avatar 24 września 2026 r., dodając niemal w czasie rzeczywistym wizualną obecność do swojej konwersacyjnej sztucznej inteligencji. Funkcja łączy natywne możliwości dialogu na żywo Gemini z wideo strumieniowym o niskich opóźnieniach, tworząc bardziej naturalne i intuicyjne interakcje dla przedsiębiorstw i ich użytkowników.

Ogłoszenie zostało napisane przez Shuo-yiin Changa, naukowca badawczego, i CJ Zhenga, inżyniera oprogramowania, w imieniu zespołu Gemini Audio Team. Nastąpiło ono tydzień po premierze Gemini 3.8 Live.

Według Google DeepMind Live Avatar łączy generowanie wideo niemal w czasie rzeczywistym z mową, dzięki czemu system może słuchać, widzieć i mówić poprzez dynamiczną wizualną personę. Funkcja została zaprojektowana z precyzyjną synchronizacją warg, naturalną mimiką twarzy i płynnym przejmowaniem kolejności w rozmowie, co pozwala uczynić usługi wirtualne bardziej interaktywnymi. Firma wymienia obsługę klienta i interaktywne instruktaże jako potencjalne zastosowania.

Gemini 3.8 Live z Live Avatar jest dostępny od dziś w Gemini Enterprise. Oryginalne ogłoszenie można znaleźć w blogu Google DeepMind.

Rozmowy multimodalne

Google DeepMind stwierdził, że rozmowa jest z natury multimodalna — obejmuje słuchanie, uwagę wzrokową, mowę i mimikę twarzy. Live Avatar przenosi te możliwości do agentów enterprise,warzając jednocześnie wejścia wizualne i audio oraz generując odpowiedzi łączące ekspresyjne audio i wideo.

Firma przedstawiła funkcję jako zdolną do odbierania tego, co widzi i słyszy, niemal w czasie rzeczywistym, a następnie odpowiadania za pomocą audio i wideo, wspierając bardziej naturalne rozmowy. W opisanych przez Google DeepMind scenariuszach obsługi klienta i interaktywnych instruktaży praktycznym efektem jest wirtualny agent, który reaguje na to, co mu pokazano, i odpowiada głosem oraz sygnałami mimiki w ramach jednej rozmowy.

Wykonywanie narzędzi w tle

Live Avatar korzysta również z możliwości rozumowania Gemini oraz asynchronicznego wywoływania narzędzi. Może inicjować wywołania narzędzi i pobierać dane w tle, kontynuując aktywną rozmowę. Pozwala mu to obsługiwać złożone zadania bez przerywania dialogu.

Google DeepMind podał zameldowanie gości w hotelu jako przykład zadania, w którym narzędzia mogą działać w tle, podczas gdy rozmowa trwa. Dla przedsiębiorstw wartością jest ciągłość: klienci doświadczają nieprzerwanej rozmowy, podczas gdy pobieranie danych i wykonywanie zadań odbywa się poza polem widzenia.

Obsługa 97 języków

Funkcja obejmuje natywną, wielojęzyczną synchronizację mowa-do-mowy. Według Google DeepMind Live Avatar może dynamicznie dostosowywać synchronizację warg i mimikę twarzy podczas przełączania między 97 językami, bez pogorszenia jakości wideo ani wystąpienia dryfu wizualnego.

Firma zademonstrowała również zmianę języka w trakcie rozmowy, z dostosowującymi się synchronizacją warg i mimiką awatara. Dla firm obsługujących użytkowników w różnych regionach ten zasięg — oraz możliwość przełączania języków bez artefaktów wizualnych — ma bezpośrednie znaczenie dla globalnych interakcji z klientami.

Konfigurowalne awatary

Organizacje mogą wybierać z biblioteki gotowych awatarów o różnych wyglądach, głosach i stylach ekspresji. Mogą również dostosowywać Live Avatary, aby odzwierciedlały tożsamość marki lub postaci.

Korzystając z wysokiej jakości obrazu referencyjnego, deweloperzy mogą wygenerować w pełni animowany i responsywny awatar, zachowując podobieństwo referencyjne, styl marki lub tożsamość postaci. Google DeepMind poinformował, że tworzenie niestandardowych awatarów jest obecnie dostępne wyłącznie poprzez listę dozwolonych klientów enterprise, a dla organizacji spoza tej listy opcją pozostaje biblioteka gotowych awatarów.

Znakowanie wodne i bezpieczeństwo

Google DeepMind stwierdził, że Live Avatar zawiera zabezpieczenia mające chronić tożsamość i zachować przejrzystość treści generowanych przez AI. Wyniki generowane przez produkty AI firmy są znakowane SynthID —idocznym znakiem wodnym osadzonym bezpośrednio w audio i wideo.

Według firmy znak wodny pomaga utrzymać wykrywalność treści generowanych przez AI i ma na celu ograniczenie dezinformacji oraz błędnego przypisania autorstwa. Dla przedsiębiorstw prezentujących klientom ekspresyjne persony wideo znak wodny to element, który pozwala identyfikować interakcje generowane przez AI jako syntetyczne. Więcej informacji o podejściu firmy do bezpieczeństwa i odpowiedzialnego wdrażania można znaleźć w jej karcie modelu.

Gemini 3.8 Live z Live Avatar jest dostępny w Gemini Enterprise. Google DeepMind skierował również deweloperów do dokumentacji API, aby rozpocząć pracę. Dla zespołów chcących awatarów dopasowanych do marki poza biblioteką gotowych opcji kluczowym elementem dostępu jest lista dozwolonych klientów enterprise dla tworzenia niestandardowych awatarów.