Google DeepMind presenta Gemini 3.8 Flash e 3.8 Flash Cyber per i flussi di lavoro agentici e la cybersecurity
Punti chiave
- •Google DeepMind ha rilasciato Gemini 3.8, il suo modello di ragionamento e coding più capace, tre settimane dopo 3.7 Flash, segnando la terza uscita Flash in sei settimane.
- •Gemini 3.8 Flash è offerto a un prezzo introduttivo di $0,75 per milione di token in input e $3,75 per milione di token in output, con tariffe che raddoppiano dal 1° gennaio 2027.
- •Gemini 3.8 Flash Cyber ha ottenuto una scoperta di vulnerabilità di livello frontier su CyberGym e oltre il 70% di successo sul benchmark interno di Google su 20 linguaggi.
- •Il team Chrome Security ha riscontrato che Flash Cyber ha prodotto 2,6 volte più patch corrette alle vulnerabilità di Chrome rispetto a modelli commerciali più grandi.
- •Flash Cyber è riservato a difensori fidati tramite il nuovo Fairwind Program, mentre 3.8 Flash è disponibile tramite la Gemini API, Gemini Enterprise e gli abbonamenti Google AI Pro e Ultra.

Google DeepMind ha presentato Gemini 3.8, il suo modello di ragionamento e coding più capace fino ad oggi, arrivato appena tre settimane dopo 3.7 Flash e a segnare la terza uscita Flash dell'azienda in sei settimane. Il ritmo accelerato riflette l'attuale cadenza del mercato dei modelli frontier, in cui Google, OpenAI e Anthropic rilasciano versioni successive a intervalli di settimane anziché di trimestri, e in cui i modelli di fascia media di classe "Flash" sono sempre più i cavalli da battaglia delle applicazioni AI in produzione. Il lancio include due varianti: Gemini 3.8 Flash, un modello generalista ad alte prestazioni, e Gemini 3.8 Flash Cyber, un modello specializzato in cybersecurity disponibile per difensori verificati tramite il nuovo Fairwind Program.
Secondo l'annuncio di Tulsee Doshi, Senior Director of Product Management, e di Raluca Ada Popa, Gemini Security Lead presso Google DeepMind, i due rilasci sono alimentati dalla stessa intelligenza di base, accelerata da cicli agentivi di lunga durata che valutano e affinano ricorsivamente i modelli sottostanti. I guadagni in coding e ragionamento su questo nucleo condiviso derivano da diverse innovazioni, tra cui un addestramento rigoroso nel dominio esigente della cybersecurity. L'abbinamento è notevole perché applica una tecnica — usare un dominio difficile e verificabile come la sicurezza come segnale di addestramento — già impiegata altrove nel settore per affinare il ragionamento generale dei modelli.
Gemini 3.8 Flash: costruito per il coding di lungo orizzonte e gli agenti autonomi
Gemini 3.8 Flash offre miglioramenti sostanziali rispetto a 3.7 Flash in ambito ingegneria del software, attività agentiche e ragionamento multistep in domini specializzati, avvicinandosi spesso alle prestazioni di modelli frontier più costosi. È disponibile allo stesso prezzo introduttivo di 3.7 Flash: $0,75 per milione di token in input e $3,75 per milione di token in output. Questo prezzo introduttivo scade il 31 dicembre 2026; dal 1° gennaio 2027 si applicheranno tariffe di $1,50 per milione di token in input e $7,50 per milione di token in output. Anche a tariffa piena, il modello è venduto ben al di sotto delle tipiche fasce frontier, a sottolineare la pressione competitiva sul prezzo per token mentre i fornitori si contendono carichi di lavoro agentivi che consumano molti più token delle interazioni di tipo chat.
Su DeepSWE v1.1 (Long-Horizon Software Engineering), 3.8 Flash supera la maggior parte dei modelli frontier più grandi nel risolvere autonomamente problemi di ingegneria complessi dall'inizio alla fine, a una frazione del costo. Il modello dimostra anche affidabilità per l'autonomia aziendale critica in domini di conoscenza specializzati. Nei campi quantitativi e professionali che richiedono analisi e reportistica avanzate, 3.8 Flash supera 3.7 Flash e altri modelli frontier in benchmark come Vals Finance Agent V2 e Harvey's Legal Agent Benchmark. Raggiunge inoltre il 54,9% su HLE-Verified, a testimoniare la capacità di ragionamento multistep in ambiti STEM, umanistici e professionali.
Questi guadagni derivano da una scelta progettuale centrale: 3.8 Flash lavora di più. Su attività complesse, il modello esegue passaggi di ragionamento aggiuntivi e chiama gli strumenti in modo iterativo, consumando talvolta più token per massimizzare le prestazioni, soprattutto ai livelli di sforzo più alti. Questo compromesso tra accuratezza e consumo di token è diventato una questione progettuale centrale per l'AI agentica, poiché gli agenti autonomi che iterano su molti passaggi possono moltiplicare i costi di inferenza; il controllo del livello di sforzo offre agli sviluppatori una leva su tale compromesso. Per le applicazioni con vincoli di calcolo, gli sviluppatori possono usare livelli di sforzo inferiori per ridurre il sovraccarico di token o continuare a basarsi su Gemini 3.7 Flash, che resta pienamente supportato per i carichi di lavoro orientati all'efficienza.
Google ha evidenziato diverse dimostrazioni realizzate con 3.8 Flash in Google Antigravity: un gioco 3D in cui un mago naviga un castello, creato da un semplice prompt con istruzione ciclica, con puzzle, narrazione ambientale e texture generate da Nano Banana; una versione DOS completamente giocabile di Google Maps con luoghi, indicazioni e Street View; una mappa topografica di siti geografici famosi con sezioni trasversali in tempo reale, proiezioni 2D e spiegazioni scientifiche basate su dataset reali dello U.S. Geological Survey; e Hardware Anatomy, un visualizzatore 3D interattivo realizzato in Google AI Studio che genera rendering Three.js realistici di smontaggi di hardware proporzionati fisicamente, con uno slider di decostruzione a livelli espandibili.
Gemini 3.8 Flash Cyber: prestazioni cyber di livello esperto
Gemini 3.8 Flash Cyber offre ai difensori capacità di livello frontier nel rilevamento delle vulnerabilità e nel patching automatizzato, con la velocità e i costi della fascia Flash per consentire iterazioni rapide. Arriva nel contesto di una spinta più ampia del settore verso la sicurezza assistita dall'AI, poiché gli attacchi alla supply chain del software e le vulnerabilità non patchate nelle grandi organizzazioni hanno reso la scoperta e la remediazione automatizzate un'area di investimento attiva nel settore della sicurezza — sollevando al contempo preoccupazioni che capacità simili, se non vincolate, potrebbero aiutare gli attaccanti.
Scoperta autonoma di vulnerabilità. Su CyberGym, il benchmark industriale standard per la ricerca di vulnerabilità, 3.8 Flash Cyber dimostra una scoperta autonoma di vulnerabilità di livello frontier, superando sia 3.5 Flash Cyber sia modelli frontier significativamente più grandi. Per riflettere meglio le esigenze difensive reali oltre alle basi di codice C/C++ coperte da CyberGym, Google ha inoltre valutato il modello su un benchmark interno completo, richiedendo la scoperta di vulnerabilità in basi di codice complesse che coprono 20 linguaggi di programmazione, dove ha raggiunto un tasso di successo superiore al 70% — un balzo considerevole rispetto ai modelli precedenti.
Patching automatizzato. Google ha dichiarato di essersi concentrata sul dotare i difensori di capacità esperte che li favoriscano rispetto agli attaccanti, investendo nella correzione delle vulnerabilità fin dall'inizio e privilegiandola rispetto alle capacità offensive come lo sfruttamento. Su CWE-Bench, un benchmark esterno di patching gestito da Collinear, 3.8 Flash Cyber si colloca sulla frontiera di Pareto con un pass@1 del 47,2% contro il 47,8% di un modello frontier leader — a un costo significativamente inferiore.
Impatto nel mondo reale. Google ha riferito di utilizzare già 3.8 Flash Cyber per mettere in sicurezza il codice in tutta l'azienda. Il team Chrome Security ha riscontrato che il modello ha prodotto 2,6 volte più patch corrette alle vulnerabilità di Chrome rispetto ai migliori modelli commerciali molto più grandi. Wiz ha riscontrato che ha ottenuto un richiamo superiore del 7,5–9,7% sul proprio benchmark interno di penetration testing a un costo inferiore di 2,3–5,2x rispetto ad altri modelli frontier leader. Il team Cloud Vulnerability Research di Google ha usato il modello per trovare una vulnerabilità fondazionale critica in meno di due ore — un processo per cui ricerca e scoperta richiedono in genere mesi. La validazione di terze parti da parte di Wiz e del benchmark esterno di Collinear offre una conferma indipendente parziale delle affermazioni di Google oltre alle valutazioni interne auto-dichiarate, sebbene le metodologie dettagliate dei benchmark restino pubblicate dai fornitori.
Costruito con la sicurezza in mente
Gemini 3.8 Flash include misure di protezione contro l'uso improprio nei domini chimico, biologico, radiologico e nucleare (CBRN) e nell'offensiva cyber, pur consentendo casi d'uso benefici, in linea con il Frontier Safety Framework di Google. 3.8 Flash Cyber presenta un insieme di mitigazioni per la cybersecurity più permissivo ed è di conseguenza riservato a difensori fidati che richiedono un insieme più completo di capacità cyber. Questo approccio ad accesso limitato riflette un dibattito più ampio nelle comunità AI e sicurezza su come distribuire potenti capacità cyber potenzialmente offensive — limitandole a difensori verificati — senza soffocare la ricerca di sicurezza legittima. Google ha inoltre rilevato che i modelli Gemini 3.8 hanno compiuto un balzo significativo nella robustezza al prompt injection secondo la misurazione di Gray Swan, proteggendo gli utenti da attacchi dannosi legati al prompt injection; il prompt injection resta uno dei rischi di sicurezza più citati per i sistemi di AI agentica che leggono contenuti non attendibili e agiscono per conto dell'utente.
Disponibilità
- Sviluppatori: costruite con 3.8 Flash ed esplorate i flussi di lavoro agent-first in Google Antigravity, oppure iniziate a sviluppare nella Gemini API tramite Google AI Studio e Android Studio, o generate interfacce in Stitch. La documentazione per sviluppatori è disponibile nei documenti per sviluppatori di Google.
- Imprese: accesso a 3.8 Flash in Gemini Enterprise.
- Consumatori: 3.8 Flash è disponibile per gli abbonati Google AI Pro e Ultra nell'app Gemini, in AI Mode nella Ricerca Google e in Gemini in Google Sheets.
- Cyber: tramite il nuovo Fairwind Program, autorità governative fidate, operatori di infrastrutture critiche e manutentori di software ricevono accesso prioritario a Gemini 3.8 Flash Cyber. Le organizzazioni possono richiedere l'accesso.
Fonte: Google DeepMind Blog