NachrichtenAktienGoogle DeepMind stellt Gemini 3.5 Transcribe für Echtzeit-Spracherkennung vor

Google DeepMind stellt Gemini 3.5 Transcribe für Echtzeit-Spracherkennung vor

Autor: Google DeepMind Blog·

Wichtige Erkenntnisse

  • Google sagte, Gemini 3.5 Transcribe sei das bislang präziseste Speech-to-Text-Modell des Unternehmens und für sprachgesteuerte Workflows entwickelt worden.
  • Das Modell bietet Echtzeit-Streaming-Transkription über die Live API und die Verarbeitung aufgezeichneter Audiodaten mit Sprecherzuordnung und Zeitstempeln über die Interactions API.
  • Google sagte, das Modell unterstütze mehr als 85 Sprachen, benutzerdefiniertes Vokabular, Live-Sprachwechsel und die Identifikation mehrerer Sprecher bei bis zu drei Sprechern in voraufgezeichnetem Audio.
  • Das Unternehmen sagte, Gemini 3.5 Transcribe verbessere sich gegenüber Chirp 3 durch geringere Latenz und bessere Wortfehlerraten, einschließlich einer 70% schnelleren Zeit bis zur finalen Transkription.
  • Google sagte, das Modell sei in der Public Preview für Entwickler, Unternehmen und Verbraucher verfügbar, unter anderem in der Gemini-App auf macOS und in Rambler auf Android.
Google DeepMind stellt Gemini 3.5 Transcribe für Echtzeit-Spracherkennung vor

Google DeepMind stellt Gemini 3.5 Transcribe für Echtzeit-Spracherkennung vor

  1. Aug. 2026

Diego Melendo Casado, Senior Director of Engineering, Gemini Audio, und Luke Leonhard, Chief of Staff, Gemini Audio, im Namen des Gemini-Audio-Teams, sagten, Google führe Gemini 3.5 Transcribe ein, das bisher präziseste Speech-to-Text-Modell des Unternehmens, das für intelligente Sprachinteraktionen entwickelt wurde.

Nach Angaben des Unternehmens unterscheidet sich Gemini 3.5 Transcribe von herkömmlichen Spracherkennungssystemen, die mit Hintergrundgeräuschen, komplexem Fachjargon und der Bereinigung von Sprechunflüssigkeiten Schwierigkeiten haben können. Google sagte, das Modell verwandle Roh-Audio direkt in genauen, ausgefeilten und formatierten Text, was für Teams wichtig sei, die Sprachtools entwickeln und brauchbare Ergebnisse ohne aufwendige Nachbearbeitung benötigen.

Google sagte, Verbraucher nutzten das Transkriptionsmodell bereits in Produkten wie der Gemini-App und auf Android, einschließlich neuer Sprachfunktionen wie Rambler auf Android und in der Gemini-App auf macOS. Entwickler können nun ähnliche Funktionen mit Gemini 3.5 Transcribe über die Gemini API in Google AI Studio und der Gemini Enterprise Agent Platform aufbauen.

Das Modell ist darauf ausgelegt, sich in Arbeitsabläufe für Sprachagenten, Echtzeit-Untertitelungstools und Analyse-Pipelines nach Anrufen einzufügen, also in Bereiche, in denen Latenz, Formatierung und Sprecherzuordnung beeinflussen können, wie schnell Transkription in Handlungen umgesetzt werden kann. Google sagte, es sei über zwei separate APIs verfügbar:

  • Echtzeit-Streaming: Kontinuierliches, bidirektionales Streaming mit Latenz unter einer Sekunde für interaktive Sprachanwendungen über die Live API mit gemini-3.5-transcribe-live.
  • Verarbeitung voraufgezeichneter Audioinhalte: Transkription von aufgezeichnetem Audio, Besprechungen, Anrufprotokollen und mehr mit Sprecherzuordnung und Zeitstempeln auf Wortebene über die Interactions API mit gemini-3.5-transcribe.

Funktionen und Leistung

Google sagte, Gemini 3.5 Transcribe sei darauf ausgelegt, natürliche Sprechweise zu erfassen, die Nutzerintention zu verstehen und benutzerdefiniertes Vokabular zu erkennen, damit Nutzer Aufgaben per Sprache ausführen können.

Das Unternehmen hob mehrere Funktionen hervor:

  • Intelligente Transkription: Behandelt Selbstkorrekturen wie „let’s meet Tuesday—no, Wednesday“, entfernt Füllwörter wie „ums“ und „ahs“ und formatiert Text automatisch.
  • Function Calling: Kann komplexe Aufgaben wie Bilderzeugung und Dateianalyse per Function Calls an andere Gemini-Modelle delegieren. Google sagte, dies sei derzeit in der Gemini-App für macOS verfügbar.
  • Präzisere Transkription: Gemessen von Artificial Analysis erreicht das Modell eine durchschnittliche Word Error Rate von 4.0% für Streaming und 2.6% für Nicht-Streaming-Anwendungsfälle. Google sagte, es zeige in lauten realen Umgebungen starke Leistung und erfasse alphanumerische Elemente wie Postleitzahlen und Bestell-IDs präzise.
  • Benutzerdefiniertes Vokabular: Erkennt spezialisierte Fachbegriffe und ungewöhnliche Schreibweisen, indem es Transkriptionen nahtlos an das vom Nutzer bereitgestellte benutzerdefinierte Vokabular anpasst.
  • Globale Sprachunterstützung: Erkennt und transkribiert automatisch mehr als 85 Sprachen und verarbeitet regionale Akzente sowie verschiedene Dialekte nahtlos.
  • Identifikation mehrerer Sprecher: Ordnet in voraufgezeichnetem Audio die Sprache mit Zeitstempeln für bis zu drei Sprecher korrekt zu; Unterstützung für mehr als drei Sprecher ist experimentell.

Google sagte, Gemini 3.5 Transcribe könne Live-Sprachwechsel und nahtlose Streaming-Transkription verarbeiten. Das Unternehmen sagte außerdem, das Modell stelle einen großen Fortschritt gegenüber dem früheren Transkriptionsmodell Chirp 3 dar, mit neuen Funktionen, besseren Wortfehlerraten und deutlich geringerer Latenz. Gemessen von Artificial Analysis verbessere sich die Zeit bis zur finalen Transkription beispielsweise um 70%. Im FLEURS-Benchmark über eine Reihe führender Sprachen und Regionen erreiche das Modell eine WER von 5.50% im Streaming-Modus und 5.04% in Nicht-Streaming-Anwendungsfällen.

Intelligente Transkription über Google-Produkte hinweg

Google sagte, Gemini 3.5 Transcribe gehe über standardmäßiges Speech-to-Text in Google-Produkten hinaus, indem es kontextbezogenes Verständnis in Oberflächen wie Gboard, Antigravity, die Gemini-App und Chrome einbringt.

In Gboard auf Android nutzt die neue Funktion Rambler Gemini 3.5 Transcribe, um gesprochene Gedanken in formatierten Text umzuwandeln und dabei Füllwörter herauszufiltern. Nutzer können Sprache auch verwenden, um Bearbeitungen vorzunehmen, Rechtschreibfehler zu korrigieren und den Schreibstil zu ändern.

In Google Antigravity verknüpft das Modell mit Zustimmung des Nutzers Bildschirminhalt und Chatverlauf, um die Transkriptionsgenauigkeit bei Dateinamen, Agenten-Gedanken und aktiven Dokumenten zu verbessern.

In Google AI Studio können Nutzer Gemini 3.5 Transcribe im Build-Modus verwenden, um Apps mit Spracheingabe zu erstellen.

In der Gemini-App auf macOS transkribiert das Modell natürliche Sprache in sauberen, formatierten Text und unterstützt Sprachbefehle, die mithilfe von Bildschirmkontext komplexere Workflows ermöglichen. Google sagte, das Modell könne im Hintergrund andere Gemini-Modelle aufrufen, um lokale Dateien zusammenzufassen, Text über Apps hinweg neu zu verwenden oder Bilder direkt an der Cursorposition nur per Sprache zu erzeugen.

Google sagte, Chrome-Unterstützung komme bald und ermögliche es Nutzern, in jedes Webfeld zu sprechen, um Antworten zu diktieren, Beiträge zu entwerfen oder Gemini in Chrome natürlicher zu nutzen.

Das Unternehmen sagte außerdem, das Modell könne Dateien analysieren, Bilder erzeugen und in der Gemini-App auf macOS nur per Sprache suchen.

Frühe Bewertungen und Ökosystem-Unterstützung

Google sagte, Entwicklerplattformen wie Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel und Vision Agents nutzten die Gemini Live API, um sprachgesteuerte Oberflächen zu entwickeln und bereitzustellen. Diese Plattformen verwalten die Echtzeit-Medienstreaming-Infrastruktur im Hintergrund, sodass Entwickler sich ganz auf die Gestaltung des Nutzererlebnisses konzentrieren können, was den Weg vom Modellzugang zu produktionsreifen Sprachanwendungen verkürzen kann.

Das Unternehmen sagte außerdem, Vivo, Intellitek Health und Lingopal hätten positives Feedback zu Gemini 3.5 Transcribe gegeben und dabei Latenz, Genauigkeit und Sprachunterstützung hervorgehoben.

Verfügbarkeit

Google sagte, Gemini 3.5 Transcribe sei in der Public Preview verfügbar:

  • Für Entwickler: Über die Gemini API in Google AI Studio und Google Antigravity.
  • Für Unternehmen: Über Gemini Enterprise Agent Platform und bald in Gemini Enterprise for Customer Experience.
  • Für alle: In der Gemini-App auf macOS auf Englisch, in Rambler auf Android in ausgewählten Ländern und Sprachen sowie bald in Chrome.