Google DeepMind uruchamia Gemini 3.8 Live i 3.8 Live Extended Thinking dla naturalnego głosowego AI
Najważniejsze informacje
- •Google DeepMind uruchomiło 15 września 2026 roku modele Gemini 3.8 Live i Gemini 3.8 Live Extended Thinking, opisując je jako swoje najbardziej zaawansowane modele dialogu na żywo do tej pory.
- •Gemini 3.8 Live Extended Thinking zajął pierwsze miejsce ogólne w Speech to Speech Quality Index serwisu Artificial Analysis, uzyskując 68,6% w agenticzym benchmarku τ-Voice i 97,7% w Big Bench Audio.
- •Modele przetwarzają dane wizualne w czasie zbliżonym do rzeczywistego, automatycznie przełączają się w trakcie rozmowy między 97 obsługiwanymi językami i wykonują narzędzia oraz wywołania API w tle, podczas gdy rozmowa trwa.
- •Gemini 3.8 Live jest pozycjonowany pod kątem skalowalności i efektywności kosztowej, natomiast Extended Thinking jest zapjektowany do zadań o wysokiej złożoności z jednoczesnym rozumowaniem i mówieniem, w tym narracją postępu w czasie rzeczywistym.
- •Oba modele są dostępne od dziś poprzez Gemini API i Google AI Studio, z wdrożeniami korporacyjnymi i konsumenckimi w Gemini Enterprise, Google Workspace, Search Live i aplikacji Gemini.

Google DeepMind ogłosiło 15 września 2026 roku uruchomienie modeli Gemini 3.8 Live i Gemini 3.8 Live Extended Thinking, które firma opisuje jako swoje najbardziej zaawansowane modele dialogu na żywo do tej pory. Według ogłoszenia oba modele wprowadzają postęp w rozumowaniu w czasie zbliżonym do rzeczywistego, aby skuteczniej wspierać agentów głosowych, z istotnymi ulepszeniami w zakresie inteligencji i rozumowania równoległego, które czynią je bardziej intuicyjnymi we współpracy i lepiej przystosowanymi do wykonywania złożonych zadań za pomocą głosu.
Artykuł został napisany przez Toma Ouyanga, Principal Engineer, oraz Malini Jaganathan, Member of Technical Staff, w imieniu zespołu Gemini Audio Team.
Google stwierdziło, że celem premiery jest uczynienie interakcji głosowych bardziej naturalnymi, płynnymi i inteligentnymi. Nowe modele obsługują złożone rozumowanie, kontekst wizualny w czasie rzeczywistym oraz wykonywanie zadań w tle bez przerywania trwającej rozmowy. Potrafią radzić sobie z przerwaniami, przełączać się między językami i wyjaśniać swój tok myślenia podczas pracy — zachowanie, które Google określa jako krok kierunku AI przypominającego prawdziwego partnera rozmowy. Niezależnie od tego, czy użytkownik rozwiązuje złożony problem, czy po prostu rozmawia, firma twierdzi, że doświadczenie zostało zaprojektowane tak, jakby AI słuchało i myślało razem z użytkownikiem. Funkcje są dostępne od dziś poprzez Gemini API, Google Workspace i aplikację Gemini.
Dwa modele kierowane są do różnych zastosowań:
- Gemini 3.8 Live został zaprojektowany pod kątem skalowalności i efektywności kosztowej, łącząc inteligencję konwersacyjną z płynnym dialogiem i ugruntowaniem wizualnym.
- Gemini 3.8 Live Extended Thinking został zaprojektowany do zadań o wysokiej złożoności, z podwyższoną inteligencją i rozumowaniem wieloetapowym.
Dla deweloperów i przedsiębiorstw Google pozycjonuje modele jako podstawowe elementy niezawodnych, gotowych do produkcji agentów głosowych. Firma dodaje również, że czynią one rozmowę z Gemini w aplikacji Gemini, Google Workspace i Wyszukiwarce bardziej płynną i współpracującą, pomagając użytkownikom realizować złożone zadania wyłącznie głosem.
Benchmarki i wydajność
Gemini 3.8 Live Extended Thinking zapewnia to, co Google opisuje jako zlecenie zadań i inteligencję klasy korporacyjnej, zajmując 1. miejsce ogólne w Speech to Speech Quality Index serwisu Artificial Analysis z wynikiem .6. Model prowadzi w zakresie agenticzego wykonywania zadań, uzyskując 68,6% w τ-Voice i 35,1% w benchmarku τ-Voice-banking firmy Sierra. Oferuje również mocne możliwości rozumowania, uzyskując 97,7% w Big Bench Audio, przy jednoczesnym utrzymaniu bardzo konkurencyjnej ceny w porównaniu z innymi modelami granicznymi.
Gemini 3.8 Live cieszy się dużym uznaniem użytkowników, zajmując drugie miejsce w Speech Agent Arena. Poza tym wynikiem, według Google, pozostaje wysoce opłacalny kosztowo, zapewniając deweloperom i przedsiębiorstwom wydajny model zaprojektowany do skalowania.
W EVA-Bench firmy ServiceNow, benchmarku do oceny agentów głosowych, Google stwierdziło, że jego modele przesuwają granicę Pareto dla złożonych przepływów pracy, skutecznie równoważąc dokładność z jakością konwersacji. Firma zaznacza, że ewaluacja została przeprowadzona na Live API na platformie Gemini Enterprise Agent Platform.
Kontekst wizualny, 97 języków i wykonywanie w tle
Gemini 3.8 Live przetwarza dane wejściowe wizualne w czasie zbliżonym do rzeczywistego, wzbogacając rozmowy o kontekst dla bardziej pomocnych odpowiedzi. Automatycznie wykrywa i przełącza się w trakcie rozmowy między 97 obsługiwanymi językami. Model wykonuje również narzędzia i wywołania API w tle, podczas gdy rozmowa trwa, co pozwala mu potwierdzać żądania i kontynuować rozmowę, podczas gdy zadania kończą się w tle.
Demonstracje wideo opublikowane wraz z ogłoszeniem pokazują model prowadzący w czasie rzeczywistym wdrożenie pracownika, odpowiadającego na bieżące pytania z użyciem kontekstu wizualnego, oraz grającego w szachy w czasie zbliżonym do rzeczywistego, łącząc kontekst wizualny, rozumowanie i naturalny przepływ konwersacji.
Rozumowanie i mówienie jednocześnie
W przypadku zadań wymagających głębszego rozumowania Gemini 3.8 Live Extended Thinking rozumuje i mówi w tym samym czasie. Google stwierdza, że model zapewnia podwyższoną inteligencję dla złożonych przepływów pracy, zachowując nieprzerwaną płynność konwersacji. Wykorzystuje wczesne sygnały słowne, takie jak „Pozwól, że to sprawdzę…”, aby naturalnie potwierdzać polecenia, oraz zapewnia narrację postępu w czasie rzeczywistym, prowadząc użytkowników przez wieloetapowe zadania w tle w miarę ich postępu.
Demonstracje obejmują Gemini 3.8 Live Extended Thinking przekształcający surowe szkice i głosowe informacje zwrotne w czasie zbliżonym do rzeczywistego w działające komponenty React oraz koordynujący wieloetapowe rezerwacje i asynchroniczne wywołania funkcji bez przerywania naturalnej rozmowy na żywo. Google pokazało również Gemini 3.8 Live tworzące kompletne plany biznesowe i niestandardowe zestawy narzędzi marketingowych na bieżąco za pomocą naturalnej mowy.
Integracja z Google Workspace i Wyszukiwarką
W Google Workspace i Wyszukiwarce modele Live zostały zaprojektowane tak, aby zapewniać bardziej intuicyjne, współpracujące doświadczenia, szczególnie przy realizacji najbardziej złożonych zadań. Gemini 3.8 Live Extended Thinking można używać w Google Workspace Docs Live, Gmail Live i Keep Live. Search Live oferuje krok po kroku pomoc w rozwiązywaniu problemów w czasie rzeczywistym opartą na Gemini 3.8 Live.
Ekosystem głosowy dla deweloperów i przedsiębiorstw
Korzystając z Gemini Live API, platformy deweloperskie, takie jak Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel i Vision Agents, umożliwiają deweloperom łatwe tworzenie i wdrażanie wydajnych interfejsów opartych na głosie. Platformy te zarządzają w tle złożoną infrastrukturą strumieniowania multimediów w czasie rzeczywistym, pozwalając deweloperom w pełni skupić się na tworzeniu doświadczenia użytkownika.
Google dodało, że współpracuje z firmami takimi jak Salesforce, Genspark i Lumeris, które są entuzjastycznie nastawione do 3.8 Live i 3.8 Live Extended Thinking, podkreślając imponujące opóźnienia, płynność i możliwości wywoływania narzędzi modeli.
Znak wodny SynthID dla przejrzystości
Całe audio generowane przez produkty AI Google jest oznaczane znakiem wodnym SynthID. Firma stwierdza, że ten niewidoczny znak wodny jest wpleciony bezpośrednio w wyjście audio, zapewniając wykrywalność treści generowanych przez AI, aby pomagać zapobiegać dezinformacji. Szczegóły dotyczące podejścia firmy do bezpieczeństwa i odpowiedzialności można znaleźć w karcie modelu.
Dostępność
Oba modele zaczynają być udostępniane od dziś, w kanałach deweloperskich, korporacyjnych i konsumenckich.
Gemini 3.8 Live:
- Dla deweloperów: w Gemini API i Google AI Studio.
- Dla przedsiębiorstw: w prywatnej wersji zapoznawczej Gemini Enterprise, a wkrótce w Gemini Enterprise for Customer Experience.
- Dla wszystkich: w Search Live.
Gemini 3.8 Live Extended Thinking:
- Dla deweloperów: w Gemini API i Google AI Studio.
- Dla przedsiębiorstw: w prywatnej wersji zapoznawczej Gemini Enterprise, a wkrótce w Gemini Enterprise for Customer Experience oraz dla klientów biznesowych Google Workspace.
- Dla wszystkich: w Gemini Live, dla subskrybentów Google AI Pro i Ultra w Workspace w Docs oraz dla wszystkich subskrybentów Google AI w Gmail i Keep.
Pełne ogłoszenie, wraz z demonstracjami wideo, jest dostępne na blogu Google DeepMind.