AktualnościAkcjeGoogle DeepMind wprowadza Gemini 3.5 Transcribe do transkrypcji mowy w czasie rzeczywistym

Google DeepMind wprowadza Gemini 3.5 Transcribe do transkrypcji mowy w czasie rzeczywistym

Autor: Google DeepMind Blog·

Najważniejsze informacje

  • Google powiedziało, że Gemini 3.5 Transcribe jest jak dotąd najdokładniejszym modelem speech-to-text i został zbudowany z myślą o workflow sterowanych głosem.
  • Model oferuje transkrypcję strumieniową w czasie rzeczywistym przez Live API oraz przetwarzanie nagranego audio z przypisaniem mówców i znacznikami czasu przez Interactions API.
  • Google powiedziało, że model obsługuje ponad 85 języków, własne słownictwo, przełączanie języków na żywo i identyfikację wielu mówców dla maksymalnie trzech osób w nagraniach audio.
  • Firma podała, że Gemini 3.5 Transcribe poprawia Chirp 3 dzięki niższym opóźnieniom i lepszym wskaźnikom błędów, w tym o 70% szybszemu czasowi do finalnej transkrypcji.
  • Google powiedziało, że model jest dostępny w publicznym podglądzie dla deweloperów, firm i użytkowników w produktach Google, w tym w aplikacji Gemini na macOS i Rambler na Androidzie.
Google DeepMind wprowadza Gemini 3.5 Transcribe do transkrypcji mowy w czasie rzeczywistym

Google DeepMind wprowadza Gemini 3.5 Transcribe do transkrypcji mowy w czasie rzeczywistym

26 sie 2026

Diego Melendo Casado, Senior Director of Engineering, Gemini Audio, oraz Luke Leonhard, Chief of Staff, Gemini Audio, w imieniu zespołu Gemini Audio, powiedzieli, że Google wprowadza Gemini 3.5 Transcribe, swój dotychczas najdokładniejszy model speech-to-text, zaprojektowany do inteligentnych interakcji głosowych.

Jak podała firma, Gemini 3.5 Transcribe różni się od tradycyjnych systemów rozpoznawania mowy, które mogą mieć trudności z hałasem w tle, złożonym żargonem i oczyszczaniem mowy z dysfluencji. Google powiedziało, że model przekształca surowy dźwięk bezpośrednio w dokładny, dopracowany i sformatowany tekst, co ma znaczenie dla zespołów tworzących narzędzia głosowe, które potrzebują użytecznego wyniku bez intensywnego postprocessingu.

Google podało, że konsumenci już korzystają z tego modelu transkrypcji w takich produktach jak aplikacja Gemini i Android, w tym z nowych funkcji głosowych, takich jak Rambler na Androidzie i w aplikacji Gemini na macOS. Deweloperzy mogą teraz budować podobne możliwości z Gemini 3.5 Transcribe za pośrednictwem Gemini API w Google AI Studio oraz Gemini Enterprise Agent Platform.

Model został zaprojektowany tak, aby pasować do procesów pracy dla asystentów głosowych, narzędzi do napisów w czasie rzeczywistym oraz potoków analitycznych po rozmowie, czyli obszarów, w których opóźnienie, formatowanie i przypisanie mówcy mogą wpływać na to, jak szybko transkrypcja może zostać wykorzystana. Google poinformowało, że model jest dostępny przez dwa oddzielne interfejsy API:

  • Strumieniowanie w czasie rzeczywistym: ciągłe, dwukierunkowe strumieniowanie z opóźnieniem poniżej sekundy dla interaktywnych aplikacji głosowych przez Live API z użyciem gemini-3.5-transcribe-live.
  • Przetwarzanie nagranego audio: transkrypcja nagranych nagrań audio, spotkań, logów rozmów i nie tylko, z przypisaniem mówców i znacznikami czasu na poziomie słów, przez Interactions API z użyciem gemini-3.5-transcribe.

Funkcje i wydajność

Google powiedziało, że Gemini 3.5 Transcribe został zaprojektowany tak, aby uchwycić naturalny styl mówienia, lepiej rozumieć intencje użytkownika i rozpoznawać własne słownictwo, dzięki czemu użytkownicy mogą wykonywać zadania głosem.

Firma wyróżniła kilka możliwości:

  • Inteligentna transkrypcja: płynnie obsługuje autokorekty, takie jak „let’s meet Tuesday—no, Wednesday”, usuwa słowa-wypełniacze, takie jak „ums” i „ahs”, oraz automatycznie formatuje tekst.
  • Function calling: model może przekazywać złożone zadania, takie jak generowanie obrazów i analiza plików, innym modelom Gemini za pośrednictwem wywołań funkcji. Google powiedziało, że jest to obecnie dostępne w aplikacji Gemini na macOS.
  • Bardziej precyzyjna transkrypcja: według pomiarów Artificial Analysis model osiąga średni Word Error Rate (WER) na poziomie 4.0% dla trybu strumieniowego i 2.6% dla zastosowań niestreamingowych. Google powiedziało, że model dobrze radzi sobie w hałaśliwych, rzeczywistych warunkach i potrafi dokładnie rozpoznawać elementy alfanumeryczne, takie jak kody pocztowe i identyfikatory zamówień.
  • Własne słownictwo: rozpoznaje specjalistyczny żargon i nietypową pisownię, płynnie dostosowując transkrypcje do dostarczonego przez użytkownika własnego słownictwa.
  • Globalna obsługa języków: automatycznie wykrywa i transkrybuje ponad 85 języków, płynnie obsługując regionalne akcenty i różnorodne dialekty.
  • Identyfikacja wielu mówców: w nagraniach audio przypisuje wypowiedzi ze znacznikami czasu dla maksymalnie trzech mówców (obsługa 3+ mówców jest eksperymentalna).

Google powiedziało, że Gemini 3.5 Transcribe obsługuje przełączanie języków na żywo i płynną transkrypcję strumieniową. Firma dodała również, że model stanowi duży krok naprzód względem poprzedniego modelu transkrypcji, Chirp 3, oferując nowe możliwości, lepsze wskaźniki błędów słów i znacząco niższe opóźnienia. Według pomiarów Artificial Analysis czas do uzyskania finalnej transkrypcji poprawia się na przykład o 70%. W benchmarku FLEURS, obejmującym zestaw najważniejszych języków i lokalizacji, Google podało, że model osiąga 5.50% WER w trybie strumieniowym oraz 5.04% WER w zastosowaniach niestreamingowych.

Inteligentna transkrypcja w produktach Google

Google powiedziało, że Gemini 3.5 Transcribe wykracza poza standardowe speech-to-text w produktach Google, dodając rozumienie kontekstowe do takich obszarów jak Gboard, Antigravity, aplikacja Gemini i Chrome.

W Gboard na Androidzie nowa funkcja Rambler wykorzystuje Gemini 3.5 Transcribe do zamiany wypowiedzianych myśli w sformatowany tekst, jednocześnie filtrując słowa-wypełniacze. Użytkownicy mogą także używać głosu do wprowadzania poprawek, korygowania błędów pisowni i zmiany stylu pisania.

W Google Antigravity model łączy kontekst ekranu i historię czatu, za zgodą użytkownika, aby zwiększyć dokładność transkrypcji dla nazw plików, myśli agenta i aktywnych dokumentów.

W Google AI Studio użytkownicy mogą uzyskać dostęp do Gemini 3.5 Transcribe w trybie Build, aby tworzyć aplikacje przy użyciu głosu.

W aplikacji Gemini na macOS model nie tylko transkrybuje naturalną mowę na czysty, sformatowany tekst, ale także umożliwia polecenia głosowe, które mogą płynnie łączyć się z kontekstem ekranu, aby obsługiwać bardziej złożone procesy. Google powiedziało, że model może w tle korzystać z innych modeli Gemini, aby podsumowywać pliki lokalne, wykorzystywać tekst ponownie w różnych aplikacjach lub generować obrazy przy kursorze, używając wyłącznie głosu.

Google powiedziało, że obsługa Chrome pojawi się wkrótce, umożliwiając użytkownikom dyktowanie w dowolnym polu webowym, aby naturalniej i łatwiej podyktować odpowiedzi, szkice postów lub wywoływać Gemini w Chrome za pomocą głosu.

Firma dodała również, że model może analizować pliki, generować obrazy i wyszukiwać w aplikacji Gemini na macOS, używając wyłącznie głosu.

Wczesne recenzje i wsparcie ekosystemu

Google powiedziało, że platformy dla deweloperów, w tym Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel i Vision Agents, korzystają z Gemini Live API do łatwego tworzenia i wdrażania interfejsów sterowanych głosem. Platformy te zarządzają w tle złożoną infrastrukturą strumieniowania multimediów w czasie rzeczywistym, dzięki czemu deweloperzy mogą skupić się wyłącznie na projektowaniu doświadczenia użytkownika.

Firma podała również, że Vivo, Intellitek Health i Lingopal przekazały pozytywne opinie na temat Gemini 3.5 Transcribe, wskazując na jego opóźnienia, dokładność i szeroką obsługę języków.

Dostępność

Google powiedziało, że Gemini 3.5 Transcribe jest dostępny w publicznym podglądzie:

  • Dla deweloperów: przez Gemini API w Google AI Studio i Google Antigravity.
  • Dla przedsiębiorstw: przez Gemini Enterprise Agent Platform, a wkrótce także w Gemini Enterprise for Customer Experience.
  • Dla wszystkich: w aplikacji Gemini na macOS w języku angielskim, w Rambler na Androidzie w wybranych krajach i językach oraz wkrótce w Chrome.