Google DeepMind introduceert Gemini 3.5 Transcribe voor realtime spraak-naar-tekst
Belangrijkste punten
- •Google zei dat Gemini 3.5 Transcribe het nauwkeurigste speech-to-text-model tot nu toe is en is gebouwd voor door stem aangestuurde workflows.
- •Het model biedt realtime streamingtranscriptie via de Live API en verwerking van opgenomen audio met sprekerattributie en tijdstempels via de Interactions API.
- •Google zei dat het model meer dan 85 talen ondersteunt, aangepaste woordenschat, live taalwisselingen en identificatie van meerdere sprekers tot maximaal drie sprekers in vooraf opgenomen audio.
- •Het bedrijf zei dat Gemini 3.5 Transcribe Chirp 3 overtreft met lagere latentie en sterkere Word Error Rates, inclusief een 70% snellere tijd tot definitieve transcriptie.
- •Google zei dat het model in publieke preview beschikbaar is voor ontwikkelaars, ondernemingen en consumenten in Google-producten, waaronder de Gemini-app op macOS en Rambler op Android.

Google DeepMind introduceert Gemini 3.5 Transcribe voor realtime spraak-naar-tekst
26 aug. 2026
Diego Melendo Casado, Senior Director of Engineering, Gemini Audio, en Luke Leonhard, Chief of Staff, Gemini Audio, namens het Gemini Audio-team, zeiden dat Google Gemini 3.5 Transcribe introduceert, het nauwkeurigste speech-to-text-model tot nu toe, ontworpen voor intelligente steminteracties.
Volgens het bedrijf verschilt Gemini 3.5 Transcribe van conventionele spraakherkenningssystemen die moeite kunnen hebben met achtergrondgeluid, complexe jargon en het opschonen van aarzelingen. Google zei dat het model ruwe audio rechtstreeks omzet in nauwkeurige, verzorgde en opgemaakte tekst, wat belangrijk is voor teams die spraaktools bouwen die bruikbare output nodig hebben zonder zware nabewerking.
Google zei dat consumenten het transcriptiemodel al gebruiken binnen producten zoals de Gemini-app en Android, inclusief nieuwe spraakfuncties zoals Rambler op Android en in de Gemini-app op macOS. Ontwikkelaars kunnen nu vergelijkbare mogelijkheden bouwen met Gemini 3.5 Transcribe via de Gemini API in Google AI Studio en het Gemini Enterprise Agent Platform.
Het model is ontworpen om in workflows te passen voor voice agents, tools voor realtime ondertiteling en pipelines voor analyse na gesprekken, gebieden waar latentie, opmaak en sprekerattributie kunnen beïnvloeden hoe snel transcriptie in actie kan worden omgezet. Google zei dat het beschikbaar is via twee afzonderlijke API's:
- Realtime streaming: Continue, bidirectionele streaming met latentie van minder dan een seconde voor interactieve spraaktoepassingen via de Live API met
gemini-3.5-transcribe-live. - Verwerking van vooraf opgenomen audio: Transcriptie van opgenomen audio, vergaderingen, gesprekslogs en meer met sprekerattributie en tijdstempels op woordniveau via de Interactions API met
gemini-3.5-transcribe.
Functies en prestaties
Google zei dat Gemini 3.5 Transcribe is ontworpen om natuurlijke spreekstijl vast te leggen, de intentie van de gebruiker beter te begrijpen en aangepaste woordenschat te herkennen, zodat gebruikers taken met hun stem kunnen uitvoeren.
Het bedrijf benadrukte verschillende mogelijkheden:
- Slimme transcriptie: Verwerkt zelfcorrecties naadloos, zoals “let’s meet Tuesday—no, Wednesday,” verwijdert vulwoorden zoals “ums” en “ahs,” en formatteert tekst automatisch.
- Function calling: Kan complexe taken, zoals het genereren van afbeeldingen en het analyseren van bestanden, via function calls delegeren aan andere Gemini-modellen. Google zei dat dit momenteel beschikbaar is in de Gemini-app voor macOS.
- Nauwkeurigere transcriptie: Gemeten door Artificial Analysis behaalt het model een gemiddelde Word Error Rate van 4.0% voor streaming en 2.6% voor niet-streaming use-cases. Google zei dat het sterk presteert in rumoerige, realistische omgevingen en alfanumerieke entiteiten zoals postcodes en order-ID's nauwkeurig kan vastleggen.
- Aangepaste woordenschat: Herkent gespecialiseerde jargon en unieke spellingen door transcripties naadloos aan te passen aan de door de gebruiker aangeleverde aangepaste woordenschat.
- Wereldwijde taalondersteuning: Detecteert en transcribeert automatisch meer dan 85 talen, en verwerkt daarbij regionale accenten en diverse dialecten.
- Identificatie van meerdere sprekers: In vooraf opgenomen audio kan het spraak met tijdstempels toewijzen aan maximaal drie sprekers, terwijl ondersteuning voor meer dan 3 sprekers experimenteel is.
Google zei dat Gemini 3.5 Transcribe live taalwisselingen en naadloze streamingtranscriptie aankan. Het bedrijf zei ook dat het model een grote stap voorwaarts betekent ten opzichte van het eerdere transcriptiemodel, Chirp 3, met nieuwe mogelijkheden, betere Word Error Rates en aanzienlijk lagere latentie. Gemeten door Artificial Analysis verbetert de tijd tot de definitieve transcriptie bijvoorbeeld met 70%. Op de FLEURS-benchmark over een reeks toptalen en regio's levert het model nauwkeurige meertalige prestaties, met een verbetering ten opzichte van Chirp 3 en een WER van 5.50% in streamingmodus en 5.04% in niet-streaming use-cases.
Slimme transcriptie en geavanceerde dicteerfuncties ervaren
Naast de Gemini API in Google AI Studio en het Gemini Enterprise Agent Platform gaat 3.5 Transcribe verder dan standaard speech-to-text om werken binnen Google natuurlijker en intuïtiever te maken. Door contextbewust begrip rechtstreeks naar alledaagse oppervlakken zoals Gboard, Antigravity, de Gemini-app en Chrome te brengen, legt het nuances, intentie en inline bewerkingen eenvoudig vast.
Op Gboard op Android transformeert de nieuwe Rambler-functie via 3.5 Transcribe gesproken gedachten in goed opgemaakte tekst, waarbij vulwoorden worden gefilterd. U kunt uw stem ook gebruiken om bewerkingen uit te voeren, spelfouten te corrigeren en de schrijfstijl te wijzigen.
In Google Antigravity combineert 3.5 Transcribe schermcontext en chatgeschiedenis, met uw toestemming, om de transcriptienauwkeurigheid te verbeteren voor bestandsnamen, agentgedachten en actieve documenten.
In Google AI Studio kunt u 3.5 Transcribe in Build-modus gebruiken om apps on the fly te vibe coderen met uw stem.
In de Gemini-app op macOS transcribeert 3.5 Transcribe niet alleen uw vrije natuurlijke spraak naar schone, opgemaakte tekst, maar maakt het ook spraakopdrachten mogelijk die naadloos kunnen worden gecombineerd met schermcontext om complexe workflows aan te sturen. Door op de achtergrond andere Gemini-modellen aan te roepen voor het zware werk, maakt het model het moeiteloos om lokale bestanden samen te vatten, tekst tussen apps opnieuw te gebruiken of afbeeldingen te genereren direct bij uw cursor — met alleen uw stem.
Binnenkort in Chrome kunt u in elk webveld tegen typen spreken — waardoor het eenvoudig wordt om antwoorden te dicteren, berichten op te stellen of Gemini in Chrome op een natuurlijkere en eenvoudigere manier met uw stem aan te sturen.
Gemini 3.5 Transcribe laat u bestanden analyseren, afbeeldingen genereren en zoeken in de Gemini-app op macOS met alleen uw stem.
Bekijk hoe Gemini 3.5 Transcribe Rambler op Android gebruikt om vulwoorden automatisch te verwijderen en spraak op te schonen.
Gemini 3.5 Transcribe benut schermcontext in Google Antigravity om een nauwkeurige transcriptie te waarborgen.
Lees de vroege beoordelingen
Door gebruik te maken van de Gemini Live API maken ontwikkelaarsplatformen zoals Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel en Vision Agents het ontwikkelaars gemakkelijk om hoogwaardige, door spraak aangestuurde interfaces te bouwen en te implementeren. Deze platforms beheren complexe real-time media-streaminginfrastructuur op de achtergrond, zodat ontwikkelaars zich volledig kunnen richten op het vormgeven van de gebruikerservaring.
Bedrijven zoals Vivo, Intellitek Health en Lingopal hebben ook positieve feedback gedeeld over 3.5 Transcribe, waarbij ze de indrukwekkende latentie, nauwkeurigheid en brede taalondersteuning benadrukten.
Begin vandaag met 3.5 Transcribe
Voor ontwikkelaars: In publieke preview in de Gemini API via Google AI Studio en Google Antigravity.
Voor ondernemingen: In publieke preview via Gemini Enterprise Agent Platform en binnenkort beschikbaar in Gemini Enterprise for Customer Experience.
Voor iedereen: In de Gemini-app op macOS in het Engels, in Rambler op Android in geselecteerde landen en talen, en binnenkort in Chrome.
Ontvang het laatste nieuws van Google in uw inbox
Meld u aan voor onze nieuwsbrieven met productupdates, informatie over evenementen, speciale aanbiedingen en meer.
Gereed. Nog één stap.
Controleer uw inbox om uw abonnement te bevestigen.
U kunt zich ook abonneren met een ander e-mailadres.
Uw gegevens worden gebruikt in overeenstemming met het privacybeleid van Google. U kunt zich op elk moment afmelden.