Google uruchamia modele audio Gemini 3.8 Live do konwersacyjnego AI w czasie rzeczywistym
Najważniejsze informacje
- •Google wydał 15 września Gemini 3.8 Live i Gemini 3.8 Live Extended Thinking — modele audio zaprojektowane do budowania agentów głosowych, którzy rozumują i wykonują zadania podczas rozmów na żywo.
- •Modele mogą wykonywać wywołania API i narzędzi podczas strumieniowania odpowiedzi audio, przyjmować wizyjne dane wejściowe na żywo i obsługują ponad 97 języków.
- •Wersja Extended Thinking zawiera konfigurowalne rozumowanie, funkcję pozwalającą użytkownikom włączać lub wyłączać wewnętrzne rozumowanie modelu.
- •Architektura oddziela opóźnienie interakcji od opóźnienia rozumowania, co pozwala agentom utrzymywać płynność rozmowy, podczas gdy rozumowanie trwa w tle, zamiast czekać na odpowiedź.
- •Analitycy widzą Google doganiającego dostawców takich jak Apple przy jednoczesnym rozwoju interakcji z AI w czasie rzeczywistym; zastosowania enterprise obejmują chatboty obsługi klienta, procesy sprzedażowe i wielomodalne aplikacje agentowe.

Google wprowadził dwa nowe modele audio, które umożliwiają przedsiębiorstwom wdrażanie inteligentnych agentów AI o głębszym rozumowaniu, większej interaktywności i konwersacyjnej szybkości.
Wydane 15 września Gemini 3.8 Live i Gemini 3.8 Live Extended Thinking pozwalają programistom budować agentów głosowych, którzy mogą rozumować i wykonywać zadania, zachowując płynność rozmowy — poinformował Google. Modele obsługują interakcję w czasie rzeczywistym bez tradycyjnej struktury prompt–odpowiedź, co pozwala użytkownikom prowadzić naturalną konwersację zamiast zadawać pojedyncze prompty.
Kluczowe możliwości modeli obejmują wykonywanie wywołań API i narzędzi — mechanizmów, za pomocą których agenci łączą się z systemami zewnętrznymi i wykonują zadania — przy jednoczesnym strumieniowaniu odpowiedzi audio do użytkowników, przyjmowanie wizyjnych danych wejściowych na żywo, które pomagają agentom rozumieć zarówno to, co użytkownicy mówią, jak i to, co widzą, oraz obsługę ponad 97 języków — zakres istotny dla przedsiębiorstw wdrażających agentów głosowych w różnych regionach. Wersja Extended Thinking dodaje konfigurowalne rozumowanie (configurable thinking), funkcję pozwalającą użytkownikom włączać lub wyłączać wewnętrzne rozumowanie modelu AI.
Premiera nastąpiła dwa tygodnie po tym, jak Google po raz pierwszy zaprezentował modele fundamentalne Gemini 3.8 Flash i 3.8 Cyber.
Możliwości modelu 3.8 Live sprawiają, że Google zdaje się doganiać dostawców takich jak Apple, który już oferuje transkrypcję w czasie rzeczywistym w aplikacjach produktywności, takich jak Notatki i Diktafon — powiedział Bradley Shimmin, analityk Futurum Group. Technologia Google jednak przenosi to na wyższy poziom, zmieniając sposób, w jaki użytkownicy wchodzą w interakcję z AI — dodał.
Prawdziwe rozmowy
„Sposób, w jaki to jest zaprojektowane … możesz dostosować jego działanie na wiele różnych sposobów” — powiedział Shimmin. Zauważył, że choć przedsiębiorstwa mogą używać modeli do tradycyjnych zastosowań tłumaczeniowych, Google zaprojektował je tak, abyownicy nie wchodzili z nimi w interakcję w schemacie prompt–odpowiedź; mogą natomiast prowadzić prawdziwą rozmowę.
„To po prostu naturalna rozmowa z możliwością przerywania jej w czasie rzeczywistym, aby coś wtrącić” — powiedział Shimmin. „Możesz wtrącić kontekst do rozmowy bez przerywania tego, co model właśnie robi.”
Dzięki zaawansowanej technologii mowy Google nowe modele nie odpowiadają jedynie na pytanie dosłownie — powiedział Sid Nag, założyciel Tekonyx.
„Model został zaprojektowany do rozumowania w tle” — powiedział Nag. „Robi to w trakcie rozmowy, więc rozmowa może trwać dalej, podczas gdy model rozumuje.”
Ta technologia to postęp, w którym opóźnienie interakcji — czyli czas między wykonaniem akcji przez użytkownika a odpowiedzią systemu — zostało oddzielone od opóźnienia rozumowania, czyli całkowitego czasu przetwarzania informacji przez model AI. To właśnie to rozdzielenie pozwala agentowi utrzymywać płynność rozmowy, podczas gdy rozumowanie trwa w tle, zamiast wstrzymywać interakcję do momentu gotowości odpowiedzi.
„Robi to w czasie rzeczywistym, zamiast się zatrzymać i wrócić z kolejną odpowiedzią” — powiedział Nag.
Modele mowy zmieniają też sposób, w jaki agent AI odpowiada i wchodzi w interakcje, ponieważ „agent AI nie musi koniecznie wybierać między byciem szybkim a byciem przemyślanym” — kontynuował Nag. „Może faktycznie utrzymywać interakcję w czasie rzeczywistym.”
Zastosowania enterprise dla nowych modeli obejmują chatboty obsługi klienta, procesy sprzedażowe oraz wielomodalne aplikacje agentowe łączące tekst, głos i wideo — powiedział Nag. Aplikacje agentowe to oprogramowanie, w którym agenci AI rozumują i wykonują zadania, zamiast jedynie odpowiadać na prompty — wzorzec, który opiera się na wywoływaniu narzędzi w trakcie rozmowy i rozumowaniu w tle, takie jakie zapewniają nowe modele.
Opracowanie: Esther Shittu, AI Business. Oryginalny artykuł: Gemini 3.8 Live Transforms Conversational AI, opublikowany 17 września 2026.