Google DeepMind presenta Gemini 3.5 Transcribe per la trascrizione speech-to-text in tempo reale
Punti chiave
- •Google ha affermato che Gemini 3.5 Transcribe è il suo modello speech-to-text più preciso finora ed è progettato per flussi di lavoro basati sulla voce.
- •Il modello offre trascrizione in streaming in tempo reale tramite la Live API ed elaborazione di audio registrato con attribuzione del parlato e timestamp tramite la Interactions API.
- •Google ha detto che il modello supporta più di 85 lingue, vocabolario personalizzato, cambio di lingua in tempo reale e identificazione di più parlanti per un massimo di tre persone nell’audio preregistrato.
- •L’azienda ha affermato che Gemini 3.5 Transcribe migliora rispetto a Chirp 3 con latenza inferiore e migliori tassi di errore sulle parole, incluso un tempo fino alla trascrizione finale più rapido del 70%.
- •Google ha detto che il modello è disponibile in anteprima pubblica per sviluppatori, aziende e consumatori all’interno dei prodotti Google, inclusa l’app Gemini su macOS e Rambler su Android.

Google DeepMind presenta Gemini 3.5 Transcribe per la trascrizione speech-to-text in tempo reale
26 ago 2026
Diego Melendo Casado, Senior Director of Engineering, Gemini Audio, e Luke Leonhard, Chief of Staff, Gemini Audio, a nome del team Gemini Audio, hanno affermato che Google sta അവതരിപ്പando Gemini 3.5 Transcribe, il suo modello speech-to-text più preciso fino a oggi, progettato per interazioni vocali intelligenti.
Secondo l’azienda, Gemini 3.5 Transcribe si distingue dai sistemi convenzionali di riconoscimento vocale che possono avere difficoltà con rumore di fondo, gergo complesso e pulizia delle disfluenze. Google ha dichiarato che il modello converte direttamente l’audio grezzo in testo accurato, rifinito e formattato, un aspetto importante per i team che costruiscono strumenti vocali e necessitano di output utilizzabili senza una pesante post-elaborazione.
Google ha affermato che i consumatori stanno già usando il modello di trascrizione in prodotti come l’app Gemini e Android, incluse nuove funzionalità vocali come Rambler su Android e nell’app Gemini su macOS. Gli sviluppatori possono ora creare funzionalità simili con Gemini 3.5 Transcribe tramite la Gemini API in Google AI Studio e Gemini Enterprise Agent Platform.
Il modello è progettato per integrarsi nei flussi di lavoro per agenti vocali, strumenti di sottotitolazione in tempo reale e pipeline di analisi post-chiamata, ambiti in cui latenza, formattazione e attribuzione del parlato possono influire sulla rapidità con cui la trascrizione può essere trasformata in azione. Google ha detto che è disponibile tramite due API separate:
- Streaming in tempo reale: offre streaming continuo bidirezionale con latenza inferiore al secondo per applicazioni vocali interattive tramite la Live API usando
gemini-3.5-transcribe-live. - Elaborazione di audio registrato: trascrive audio registrati, riunioni, log di chiamate e altro con attribuzione del parlato e timestamp a livello di parola tramite la Interactions API usando
gemini-3.5-transcribe.
Funzionalità e prestazioni
Google ha dichiarato che Gemini 3.5 Transcribe è progettato per cogliere lo stile di parlato naturale, comprendere l’intento dell’utente e riconoscere vocabolario personalizzato, così da permettere di eseguire attività con la voce.
L’azienda ha evidenziato diverse funzionalità:
- Trascrizione intelligente: gestisce senza problemi le autocorrezioni, come “let’s meet Tuesday—no, Wednesday”, rimuove parole riempitive come “ums” e “ahs” e formatta automaticamente il testo.
- Function calling: può delegare attività complesse, come generazione di immagini e analisi di file, ad altri modelli Gemini tramite chiamate di funzione. Google ha detto che questa funzione è attualmente disponibile nell’app Gemini per macOS.
- Trascrizione più precisa: secondo Artificial Analysis, il modello raggiunge un Word Error Rate medio del 4.0% per lo streaming e del 2.6% per i casi d’uso non in streaming. Google ha affermato che mostra solide prestazioni in ambienti rumorosi del mondo reale e riesce a cogliere con precisione entità alfanumeriche come codici postali e ID ordine.
- Vocabolario personalizzato: riconosce gergo specializzato e ortografie uniche adattando senza problemi le trascrizioni al vocabolario personalizzato fornito dall’utente.
- Supporto linguistico globale: rileva e trascrive automaticamente più di 85 lingue, gestendo senza problemi accenti regionali e dialetti diversi.
- Identificazione di più parlanti: in audio preregistrato, attribuisce il parlato con timestamp per un massimo di tre parlanti (il supporto per più di 3 parlanti è sperimentale).
Google ha affermato che Gemini 3.5 Transcribe può gestire cambi di lingua in tempo reale e trascrizione in streaming senza interruzioni. L’azienda ha inoltre detto che il modello rappresenta un importante passo avanti rispetto al precedente modello di trascrizione, Chirp 3, con nuove funzionalità, tassi di errore sulle parole migliori e latenza significativamente inferiore. Secondo Artificial Analysis, il tempo fino alla trascrizione finale migliora del 70%. Sul benchmark FLEURS, su un insieme di lingue e località principali, il modello offre prestazioni multilingue precise, migliorando rispetto a Chirp 3 e raggiungendo un WER del 5.50% in modalità streaming e del 5.04% nei casi d’uso non in streaming.
Trascrizione intelligente e dettatura avanzata nei prodotti Google
Oltre alla Gemini API in Google AI Studio e Gemini Enterprise Agent Platform, 3.5 Transcribe va oltre il tradizionale speech-to-text per rendere il lavoro tra i prodotti Google più naturale e intuitivo. Portando un’interpretazione consapevole del contesto direttamente in superfici di uso quotidiano come Gboard, Antigravity, l’app Gemini e Chrome, cattura sfumature, intenzioni e modifiche inline con facilità.
Su Gboard su Android, tramite la nuova funzionalità Rambler, 3.5 Transcribe trasforma i pensieri espressi a voce in testo ben formattato, filtrando le parole riempitive. È anche possibile usare la voce per apportare modifiche, correggere errori di ortografia e cambiare lo stile di scrittura.
Su Google Antigravity, 3.5 Transcribe combina il contesto dello schermo e la cronologia della chat, con il tuo permesso, per garantire una precisione di trascrizione puntuale su nomi di file, pensieri dell’agente e documenti attivi.
In Google AI Studio, è possibile accedere a 3.5 Transcribe in modalità Build per creare app con il voice coding al volo usando la voce.
Nell’app Gemini su macOS, 3.5 Transcribe non solo trascrive il parlato naturale in testo pulito e formattato, ma abilita anche comandi vocali che possono integrarsi senza soluzione di continuità con il contesto dello schermo per attivare flussi di lavoro complessi. Richiamando altri modelli Gemini in background per svolgere il lavoro più pesante, il modello rende semplice riassumere file locali, riutilizzare testo tra app o generare immagini direttamente nel punto del cursore, usando solo la voce.
In arrivo su Chrome, sarà possibile parlare per digitare in qualsiasi campo web, rendendo semplice dettare risposte, abbozzare post o interpellare Gemini in Chrome in modo più naturale e semplice con la voce.
Gemini 3.5 Transcribe consente di analizzare file, generare immagini e cercare nell’app Gemini su macOS usando solo la voce.
Guarda come Gemini 3.5 Transcribe usa Rambler su Android per rimuovere automaticamente le parole riempitive e pulire il parlato.
Gemini 3.5 Transcribe sfrutta il contesto dello schermo in Google Antigravity per garantire una precisione di trascrizione accurata.
Leggi le prime recensioni
Sfruttando la Gemini Live API, piattaforme per sviluppatori come Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel e Vision Agents consentono agli sviluppatori di costruire e distribuire con facilità interfacce ad alte prestazioni basate sulla voce. Queste piattaforme gestiscono dietro le quinte infrastrutture complesse di streaming multimediale in tempo reale, permettendo agli sviluppatori di concentrarsi interamente sulla progettazione dell’esperienza utente.
Anche aziende come Vivo, Intellitek Health e Lingopal hanno condiviso feedback positivi su 3.5 Transcribe, evidenziandone la latenza, l’accuratezza e l’ampio supporto linguistico.
Inizia a usare 3.5 Transcribe oggi
Per gli sviluppatori: in anteprima pubblica nella Gemini API tramite Google AI Studio e Google Antigravity.
Per le aziende: in anteprima pubblica tramite Gemini Enterprise Agent Platform e presto in Gemini Enterprise for Customer Experience.
Per tutti: nell’app Gemini su macOS in inglese, in Rambler su Android in paesi e lingue selezionati, e presto in Chrome.
Ricevi le ultime novità da Google nella tua casella di posta
Iscriviti alle nostre newsletter con aggiornamenti sui prodotti, informazioni sugli eventi, offerte speciali e altro ancora.
Fatto. Ancora un passo.
Controlla la tua casella di posta per confermare l’iscrizione.
Puoi anche iscriverti con un indirizzo email diverso.
Le tue informazioni saranno utilizzate in conformità con l’informativa sulla privacy di Google. Puoi annullare l’iscrizione in qualsiasi momento.