Google DeepMind wprowadza Gemini 3.5 Transcribe do transkrypcji mowy w czasie rzeczywistym
Najważniejsze informacje
- •Google powiedziało, że Gemini 3.5 Transcribe jest jak dotąd najdokładniejszym modelem speech-to-text i został zbudowany z myślą o workflow sterowanych głosem.
- •Model oferuje transkrypcję strumieniową w czasie rzeczywistym przez Live API oraz przetwarzanie nagranego audio z przypisaniem mówców i znacznikami czasu przez Interactions API.
- •Google powiedziało, że model obsługuje ponad 85 języków, własne słownictwo, przełączanie języków na żywo i identyfikację wielu mówców dla maksymalnie trzech osób w nagraniach audio.
- •Firma podała, że Gemini 3.5 Transcribe poprawia Chirp 3 dzięki niższym opóźnieniom i lepszym wskaźnikom błędów, w tym o 70% szybszemu czasowi do finalnej transkrypcji.
- •Google powiedziało, że model jest dostępny w publicznym podglądzie dla deweloperów, firm i użytkowników w produktach Google, w tym w aplikacji Gemini na macOS i Rambler na Androidzie.

Google DeepMind wprowadza Gemini 3.5 Transcribe do transkrypcji mowy w czasie rzeczywistym
26 sie 2026
Diego Melendo Casado, Senior Director of Engineering, Gemini Audio, oraz Luke Leonhard, Chief of Staff, Gemini Audio, w imieniu zespołu Gemini Audio, powiedzieli, że Google wprowadza Gemini 3.5 Transcribe, swój dotychczas najdokładniejszy model speech-to-text, zaprojektowany do inteligentnych interakcji głosowych.
Jak podała firma, Gemini 3.5 Transcribe różni się od tradycyjnych systemów rozpoznawania mowy, które mogą mieć trudności z hałasem w tle, złożonym żargonem i oczyszczaniem mowy z dysfluencji. Google powiedziało, że model przekształca surowy dźwięk bezpośrednio w dokładny, dopracowany i sformatowany tekst, co ma znaczenie dla zespołów tworzących narzędzia głosowe, które potrzebują użytecznego wyniku bez intensywnego postprocessingu.
Google podało, że konsumenci już korzystają z tego modelu transkrypcji w takich produktach jak aplikacja Gemini i Android, w tym z nowych funkcji głosowych, takich jak Rambler na Androidzie i w aplikacji Gemini na macOS. Deweloperzy mogą teraz budować podobne możliwości z Gemini 3.5 Transcribe za pośrednictwem Gemini API w Google AI Studio oraz Gemini Enterprise Agent Platform.
Model został zaprojektowany tak, aby pasować do procesów pracy dla asystentów głosowych, narzędzi do napisów w czasie rzeczywistym oraz potoków analitycznych po rozmowie, czyli obszarów, w których opóźnienie, formatowanie i przypisanie mówcy mogą wpływać na to, jak szybko transkrypcja może zostać wykorzystana. Google poinformowało, że model jest dostępny przez dwa oddzielne interfejsy API:
- Strumieniowanie w czasie rzeczywistym: ciągłe, dwukierunkowe strumieniowanie z opóźnieniem poniżej sekundy dla interaktywnych aplikacji głosowych przez Live API z użyciem
gemini-3.5-transcribe-live. - Przetwarzanie nagranego audio: transkrypcja nagranych nagrań audio, spotkań, logów rozmów i nie tylko, z przypisaniem mówców i znacznikami czasu na poziomie słów, przez Interactions API z użyciem
gemini-3.5-transcribe.
Funkcje i wydajność
Google powiedziało, że Gemini 3.5 Transcribe został zaprojektowany tak, aby uchwycić naturalny styl mówienia, lepiej rozumieć intencje użytkownika i rozpoznawać własne słownictwo, dzięki czemu użytkownicy mogą wykonywać zadania głosem.
Firma wyróżniła kilka możliwości:
- Inteligentna transkrypcja: płynnie obsługuje autokorekty, takie jak „let’s meet Tuesday—no, Wednesday”, usuwa słowa-wypełniacze, takie jak „ums” i „ahs”, oraz automatycznie formatuje tekst.
- Function calling: model może przekazywać złożone zadania, takie jak generowanie obrazów i analiza plików, innym modelom Gemini za pośrednictwem wywołań funkcji. Google powiedziało, że jest to obecnie dostępne w aplikacji Gemini na macOS.
- Bardziej precyzyjna transkrypcja: według pomiarów Artificial Analysis model osiąga średni Word Error Rate (WER) na poziomie 4.0% dla trybu strumieniowego i 2.6% dla zastosowań niestreamingowych. Google powiedziało, że model dobrze radzi sobie w hałaśliwych, rzeczywistych warunkach i potrafi dokładnie rozpoznawać elementy alfanumeryczne, takie jak kody pocztowe i identyfikatory zamówień.
- Własne słownictwo: rozpoznaje specjalistyczny żargon i nietypową pisownię, płynnie dostosowując transkrypcje do dostarczonego przez użytkownika własnego słownictwa.
- Globalna obsługa języków: automatycznie wykrywa i transkrybuje ponad 85 języków, płynnie obsługując regionalne akcenty i różnorodne dialekty.
- Identyfikacja wielu mówców: w nagraniach audio przypisuje wypowiedzi ze znacznikami czasu dla maksymalnie trzech mówców (obsługa 3+ mówców jest eksperymentalna).
Google powiedziało, że Gemini 3.5 Transcribe obsługuje przełączanie języków na żywo i płynną transkrypcję strumieniową. Firma dodała również, że model stanowi duży krok naprzód względem poprzedniego modelu transkrypcji, Chirp 3, oferując nowe możliwości, lepsze wskaźniki błędów słów i znacząco niższe opóźnienia. Według pomiarów Artificial Analysis czas do uzyskania finalnej transkrypcji poprawia się na przykład o 70%. W benchmarku FLEURS, obejmującym zestaw najważniejszych języków i lokalizacji, Google podało, że model osiąga 5.50% WER w trybie strumieniowym oraz 5.04% WER w zastosowaniach niestreamingowych.
Inteligentna transkrypcja w produktach Google
Google powiedziało, że Gemini 3.5 Transcribe wykracza poza standardowe speech-to-text w produktach Google, dodając rozumienie kontekstowe do takich obszarów jak Gboard, Antigravity, aplikacja Gemini i Chrome.
W Gboard na Androidzie nowa funkcja Rambler wykorzystuje Gemini 3.5 Transcribe do zamiany wypowiedzianych myśli w sformatowany tekst, jednocześnie filtrując słowa-wypełniacze. Użytkownicy mogą także używać głosu do wprowadzania poprawek, korygowania błędów pisowni i zmiany stylu pisania.
W Google Antigravity model łączy kontekst ekranu i historię czatu, za zgodą użytkownika, aby zwiększyć dokładność transkrypcji dla nazw plików, myśli agenta i aktywnych dokumentów.
W Google AI Studio użytkownicy mogą uzyskać dostęp do Gemini 3.5 Transcribe w trybie Build, aby tworzyć aplikacje przy użyciu głosu.
W aplikacji Gemini na macOS model nie tylko transkrybuje naturalną mowę na czysty, sformatowany tekst, ale także umożliwia polecenia głosowe, które mogą płynnie łączyć się z kontekstem ekranu, aby obsługiwać bardziej złożone procesy. Google powiedziało, że model może w tle korzystać z innych modeli Gemini, aby podsumowywać pliki lokalne, wykorzystywać tekst ponownie w różnych aplikacjach lub generować obrazy przy kursorze, używając wyłącznie głosu.
Google powiedziało, że obsługa Chrome pojawi się wkrótce, umożliwiając użytkownikom dyktowanie w dowolnym polu webowym, aby naturalniej i łatwiej podyktować odpowiedzi, szkice postów lub wywoływać Gemini w Chrome za pomocą głosu.
Firma dodała również, że model może analizować pliki, generować obrazy i wyszukiwać w aplikacji Gemini na macOS, używając wyłącznie głosu.
Wczesne recenzje i wsparcie ekosystemu
Google powiedziało, że platformy dla deweloperów, w tym Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel i Vision Agents, korzystają z Gemini Live API do łatwego tworzenia i wdrażania interfejsów sterowanych głosem. Platformy te zarządzają w tle złożoną infrastrukturą strumieniowania multimediów w czasie rzeczywistym, dzięki czemu deweloperzy mogą skupić się wyłącznie na projektowaniu doświadczenia użytkownika.
Firma podała również, że Vivo, Intellitek Health i Lingopal przekazały pozytywne opinie na temat Gemini 3.5 Transcribe, wskazując na jego opóźnienia, dokładność i szeroką obsługę języków.
Dostępność
Google powiedziało, że Gemini 3.5 Transcribe jest dostępny w publicznym podglądzie:
- Dla deweloperów: przez Gemini API w Google AI Studio i Google Antigravity.
- Dla przedsiębiorstw: przez Gemini Enterprise Agent Platform, a wkrótce także w Gemini Enterprise for Customer Experience.
- Dla wszystkich: w aplikacji Gemini na macOS w języku angielskim, w Rambler na Androidzie w wybranych krajach i językach oraz wkrótce w Chrome.