NotizieAzioniGoogle DeepMind presenta Gemini 4 Argon, il suo modello di IA frontier di nuova generazione

Google DeepMind presenta Gemini 4 Argon, il suo modello di IA frontier di nuova generazione

Autore: Google DeepMind Blog·

Punti chiave

  • •Gemini 4 Argon registra risultati all’avanguardia in diversi benchmark, con il 77.9% su DeepSWE v1.1 per l’ingegneria del software di lunga durata, il 51.3% su AutomationBench di Zapier e il 91.7% su LVBench per la comprensione di video lunghi.
  • •Il limite di output del modello è stato ampliato a 1 milione di token, circa quindici volte i precedenti 64.000, una capacità che secondo Google consente di risolvere problemi difficili in un unico passaggio.
  • •Argon può scoprire, validare e correggere autonomamente vulnerabilità critiche; attraverso l’iniziativa Scan for Good di Wiz ha individuato una falla critica che esponeva informazioni personali sensibili in software sanitari utilizzati da ospedali di tutto il mondo, non rilevata dai precedenti modelli frontier.
  • •La disponibilità seguirà una distribuzione graduale: i difensori informatici selezionati avranno inizialmente accesso attraverso il Fairwind Program senza sistemi di sicurezza informatica, mentre sviluppatori, aziende e consumatori accederanno in seguito, a partire dai clienti API a pagamento e dagli abbonati a Google AI Ultra.
  • •All’interno di Google, gli agenti Argon hanno superato del 40% un benchmark pubblicato per un algoritmo quantistico, liberato oltre 300 TiB di memoria nei data center e stanno migrando grandi codebase C/C++ a Rust, inclusi oltre 800.000 righe del kernel Zircon di Fuchsia OS.
Google DeepMind presenta Gemini 4 Argon, il suo modello di IA frontier di nuova generazione

Google DeepMind ha annunciato il 30 settembre 2026 Gemini 4 Argon, un nuovo modello di IA frontier progettato per sostenere un ragionamento approfondito in flussi di lavoro professionali complessi e di lunga durata. L’azienda ha dichiarato che il modello offre prestazioni frontier nell’ingegneria del software reale, nelle attività aziendali come quelle legali e finanziarie e nella cybersecurity difensiva, e che inizialmente viene distribuito a un gruppo di difensori informatici selezionati attraverso il Fairwind Program.

Koray Kavukcuoglu, SVP di Google DeepMind e Chief AI Architect di Google, ha annunciato il modello in un post sul blog, scrivendo che Argon sta «cambiando radicalmente il modo in cui lavoriamo e costruiamo in Google». L’azienda ha evidenziato il limite leader del settore di 1 milione di token del modello per la risoluzione di problemi profondi e articolati, oltre alle sue capacità di programmazione, ricerca finanziaria, redazione legale e applicazione autonoma di patch alle vulnerabilità informatiche.

Distribuzione graduale e prezzi

Google ha dichiarato che il rilascio sicuro di capacità frontier di questo livello richiede un approccio graduale. L’azienda partecipa attivamente al processo volontario del governo statunitense per l’accesso ai modelli prima del rilascio, mentre amplia progressivamente la disponibilità, e continuerà a raccogliere il feedback dei primi tester perfezionando i sistemi di sicurezza prima di rendere Argon disponibile a sviluppatori, aziende e consumatori. Il piano di accesso iniziale significa che le capacità e le misure di sicurezza descritte da Google vengono prima valutate in contesti controllati, anziché essere offerte immediatamente al mercato più ampio.

Argon sarà lanciato a un prezzo introduttivo di $2 per milione di token in input e $10 per milione di token in output, con i token in input memorizzati nella cache a un prezzo scontato del 95% rispetto al prezzo dei token in input. Al termine del periodo introduttivo, si applicheranno prezzi di $4 per 1 milione di token in input e $20 per 1 milione di token in output. La distribuzione più ampia inizierà dai clienti API a pagamento e dagli abbonati a Google AI Ultra.

Come Google cambia il modo di lavorare e costruire

Gemini 4 Argon alimenta già i flussi di lavoro interni di Google, con migliaia di dipendenti che ne evidenziano i punti di forza nelle attività di programmazione specializzata, nella ricerca più approfondita e nella qualità della scrittura. Google ha affermato che il modello aiuta i team a costruire più rapidamente, a superare i limiti della produttività ingegneristica e ad accelerare le innovazioni. Tra gli esempi citati nel post figurano:

  • Ottimizzazione algoritmica quantistica: Argon aiuta i ricercatori di Google nel calcolo quantistico a ottimizzare le risorse spazio-temporali (qubit × gate) delle subroutine che rappresentano colli di bottiglia per applicazioni importanti. In un caso, ha superato del 40% il benchmark pubblicato nel giro di pochi minuti.
  • Efficienza della memoria: Un team di agenti Argon ha analizzato i dati di profilazione dell’intera flotta per individuare e applicare autonomamente ottimizzazioni della memoria nei data center di Google, liberando oltre 300 TiB di memoria una volta completata la distribuzione, con un risparmio totale stimato tra 500 TiB e 1 PiB.
  • Migrazione e ottimizzazione di codebase su larga scala: Gli agenti Argon stanno lavorando alla migrazione delle codebase C/C++ a Rust in tutta Google, passando da decine di migliaia di righe nelle librerie principali come re2 e libgav1 a oltre 800.000 righe per il kernel Zircon di Fuchsia OS. Data la criticità di molti di questi sistemi, le riscritture su larga scala sono sottoposte a rigorosi audit automatizzati e manuali, test di emulazione e revisioni prima della distribuzione in produzione. Per libgav1, il software open source di Google per la decodifica video, gli agenti Argon hanno utilizzato una porta Rust esistente e sostituito 32.000 righe di codice SIMD eseguendo numerosi cicli di esperimenti guidati dai profili, studiando l’output del compilatore e producendo Rust sicuro affinché il compilatore potesse vettorizzarlo automaticamente. Il risultato è un decoder video memory-safe che funziona 2.7x più velocemente della porta Rust, con un output video identico, avvicinandosi all’implementazione C++ ottimizzata.

Un limite di output di 1 milione di token

Per supportare le capacità di Gemini 4 Argon nei casi d’uso più lunghi e complessi, Google ha dichiarato di stare ampliando il limite di output del modello a 1 milione di token, un valore leader del settore rispetto ai precedenti 64.000 token. Secondo l’azienda, quando il modello dispone dello spazio necessario per riflettere in profondità e generare centinaia di migliaia di token in un’unica traiettoria, raggiunge un nuovo livello di profondità del ragionamento che consente di risolvere problemi difficili in un solo passaggio.

Programmazione e flussi di lavoro aziendali in diversi ambiti

Google ha affermato che le capacità di Gemini 4 Argon nella programmazione, nel ragionamento e nella multimodalità, insieme alla capacità di sostenere attività lunghe e articolate, gli consentono di eccellere in una serie di flussi di lavoro aziendali. Gli ingegneri di Google utilizzano il modello per attività quotidiane che vanno dal debugging ordinario alla migrazione di codebase su larga scala e alla progettazione di algoritmi. Argon stabilisce un nuovo stato dell’arte su DeepSWE v1.1, che misura le prestazioni di un modello nelle attività reali di ingegneria del software di lunga durata, con un punteggio del 77.9%.

Oltre alla programmazione, Google ha dichiarato che Argon è il modello leader nel Vals Index, che misura l’impatto economico nelle attività finanziarie, di programmazione, legali e fiscali, ponderando ogni settore in base al suo contributo al PIL degli Stati Uniti. L’azienda ha riferito prestazioni analogamente elevate in altre valutazioni specifiche di settore, tra cui Vals Finance Agent v2, che misura la ricerca finanziaria articolata, e Harvey’s Legal Agent Benchmark, dedicato alla ricerca e alla redazione legale. In AutomationBench, il benchmark di Zapier che misura l’esecuzione end-to-end nelle principali funzioni aziendali, Argon si classifica al primo posto con un punteggio del 51.3%.

Argon è inoltre particolarmente efficace quando il lavoro basato sulla conoscenza richiede comprensione visiva, secondo Google. Il modello può gestire l’analisi professionale di grafici, individuare dettagli in video lunghi e intraprendere azioni sulla base di una serie di documenti. Su LVBench, che misura la comprensione di video lunghi, l’azienda ha dichiarato che Argon rappresenta lo stato dell’arte con un punteggio del 91.7%.

Leadership nella cybersecurity difensiva

Google ha dichiarato di aver addestrato Gemini Argon per renderlo altamente efficace nella cybersecurity difensiva e fornire ai difensori informatici strumenti migliori nella nuova era degli attacchi informatici. Il modello può individuare, validare e correggere autonomamente vulnerabilità software critiche. Per i difensori selezionati e i propri team interni, l’azienda distribuirà Argon senza sistemi di sicurezza informatica, consentendo loro di sfruttarne tutte le capacità frontier nella cybersecurity difensiva.

La società di sicurezza Wiz utilizza già Argon per la cybersecurity difensiva attraverso la sua iniziativa Scan for Good, un programma dedicato alla protezione gratuita delle infrastrutture pubbliche critiche tramite l’individuazione e la risoluzione di esposizioni ad alto rischio. In una prima dimostrazione del suo impatto, Google ha dichiarato che Argon ha scoperto una vulnerabilità critica che esponeva informazioni personali sensibili in software sanitari utilizzati da ospedali di tutto il mondo, individuando un rischio grave che i precedenti modelli frontier non avevano rilevato.

Su CWE-bench v1, che valuta la capacità di un modello di risolvere vulnerabilità di sicurezza, Argon è a pari merito al primo posto con un punteggio massimo del 68%, sulla scia delle prestazioni frontier di 3.8 Flash Cyber su CWE-bench v0.

Google ha affermato che Gemini 4 Argon compie progressi significativi nella scoperta delle vulnerabilità rispetto a 3.8 Flash Cyber:

  • Nel benchmark interno completo di Google sulle vulnerabilità, Argon ha individuato un’ampia gamma di esposizioni in codebase complesse che comprendevano 20 linguaggi di programmazione.
  • Nel benchmark interno di Wiz sui penetration test black-box, che valuta la capacità di un modello di analizzare sistemi web attivi senza accedere al codice sorgente, Argon supera 3.8 Flash Cyber nell’individuazione della superficie d’attacco, nell’identificazione delle vulnerabilità e nella produzione di prove di concetto per convalidarle.

Rafforzamento delle misure di sicurezza frontier

Prima di distribuire Gemini 4 Argon su larga scala, Google ha dichiarato di continuare a rafforzare le misure di sicurezza frontier critiche in quattro aree principali:

  • Difesa dagli abusi: Per impedire che soggetti malintenzionati utilizzino Argon per attacchi informatici o chimici, biologici, radiologici e nucleari (CBRN), il modello è progettato per rifiutare le richieste dannose preservando al contempo la ricerca scientifica legittima a duplice uso, in conformità con il Frontier Safety Framework di Google DeepMind. L’azienda sta rafforzando la solidità delle misure di sicurezza per questo lancio, anche migliorando le tecniche per monitorare le attivazioni interne del modello e individuare eventuali abusi. Le misure sono state sottoposte a test di robustezza da parte di red team interni ed esterni, utilizzando una combinazione di metodi di attacco manuali e automatizzati.
  • Difesa dagli attacchi di prompt injection: Google ha descritto Argon come il modello più resiliente finora contro le prompt injection indirette, nelle quali istruzioni o contesti dannosi vengono utilizzati per dirottare il comportamento di un modello. Secondo l’azienda, si tratta di attacchi complessi che richiedono vigilanza costante e più livelli di difesa. Attraverso red teaming automatizzato e addestramento avversariale, Gemini 4 Argon è leader nella robustezza contro le prompt injection sul benchmark Indirect Prompt Injection (IPI) di Gray Swan.
  • Monitoraggio del disallineamento: Per impedire ad Argon di oltrepassare i limiti nel tentativo di completare un’attività in modi che vadano oltre le intenzioni dell’utente, Google sta implementando misure di mitigazione del disallineamento che monitorano la catena di pensiero e le azioni del modello, interrompendo l’esecuzione quando necessario. L’azienda ha utilizzato un sistema simile per monitorare i propri cicli di addestramento e inviare avvisi a un team dedicato alla risposta agli incidenti, adottando precauzioni per evitare di reinserire i risultati nell’addestramento e rischiare così di influenzare il ragionamento di Argon affinché eluda il monitoraggio. Google ha dichiarato di incoraggiare fortemente il resto del settore a preservare la trasparenza del ragionamento «in questi momenti decisivi di aumento delle capacità, mentre si affrontano i rischi di allineamento», affinché i pensieri del modello restino utili per identificare e diagnosticare il disallineamento.
  • Rafforzamento dei sistemi: Con l’aumento delle capacità dei modelli frontier, Google ha affermato che testarli in sicurezza richiede ambienti protetti in grado di tenere il passo con i sistemi stessi. In linea con la propria roadmap per il controllo degli agenti, l’azienda sta rafforzando gli ambienti sandbox isolandoli e sigillandoli prima dell’avvio di addestramenti o valutazioni ad alto rischio. Google si è inoltre impegnata a condividere con i partner queste migliori pratiche di sicurezza per gli agenti, al fine di migliorare la sicurezza dell’intero ecosistema.

Disponibile a breve

Google ha dichiarato di aver sviluppato Gemini 4 Argon con capacità frontier nella programmazione, nel lavoro basato sulla conoscenza, nella cybersecurity difensiva e nella scrittura creativa, per fungere da partner di sviluppatori, professionisti e aziende impegnati ad affrontare i problemi più difficili. L’azienda ha espresso gratitudine alla prima coorte di difensori informatici e tester selezionati, le cui valutazioni nel mondo reale e il cui feedback contribuiranno a rafforzare i sistemi prima del rilascio a sviluppatori, aziende e consumatori, a partire dai clienti API a pagamento e dagli abbonati a Google AI Ultra.

Informazioni sull’autore: Koray Kavukcuoglu è uno dei massimi esperti mondiali di intelligenza artificiale. In qualità di SVP di Google DeepMind, guida lo sviluppo dei modelli di IA generativa all’avanguardia di Google DeepMind e la loro integrazione su larga scala nei prodotti Google. Prima di ricoprire l’attuale incarico, è stato VP of Research presso Google DeepMind, dove ha fondato il team di deep learning, autore di importanti innovazioni nella ricerca come DQN (Deep Q-Network) e WaveNet.