NotizieMacroGoogle rilascia Gemini 3.7 Flash mentre OpenAI presenta in anteprima GPT-5.6 Sol Ultrafast, fino a 14 volte più veloce

Google rilascia Gemini 3.7 Flash mentre OpenAI presenta in anteprima GPT-5.6 Sol Ultrafast, fino a 14 volte più veloce

Autore: Decrypt·

Punti chiave

  • Gemini 3.7 Flash è in disponibilità generale e può essere utilizzato in più di 160 paesi.
  • Il modello accetta fino a un milione di token di input e può elaborare testo, immagini, video, audio, PDF e chiamate di strumenti.
  • Secondo Google, Gemini 3.7 Flash ha completato il suo compito di programmazione di test in 2 minuti e 13 secondi, più velocemente del precedente modello Flash.
  • OpenAI ha presentato in anteprima GPT-5.6 Sol Ultrafast come livello API su invito che usa chip Cerebras e raggiunge fino a 750 token di output al secondo.
  • Google ha fissato il prezzo di Gemini 3.7 Flash a 75 centesimi di dollaro per milione di token di input e 3,75 dollari per milione di token di output fino alla fine dell'anno, prima dell'aumento delle tariffe il 31 dicembre.
Google rilascia Gemini 3.7 Flash mentre OpenAI presenta in anteprima GPT-5.6 Sol Ultrafast, fino a 14 volte più veloce

Giovedì Google ha lanciato Gemini 3.7 Flash, un modello economico per la programmazione e gli agenti ora in disponibilità generale. Lo stesso giorno, OpenAI ha presentato in anteprima GPT-5.6 Sol Ultrafast, un livello di servizio alimentato da Cerebras che esegue il suo modello più potente fino a 14x più velocemente. La corsa alla velocità si è spostata dall'intelligenza pura agli agenti in tempo reale — ma oggi solo il modello di Google è disponibile per tutti gli sviluppatori.

Google e OpenAI hanno lanciato entrambe lo stesso messaggio: l'IA è oggi abbastanza veloce da risultare impressionante per chi usa agenti di IA, con ciascuna azienda che annuncia modelli ultra-veloci. I due lanci sono costruiti in modo diverso e oggi solo uno è realmente nelle mani degli sviluppatori. L'attenzione alla velocità è strutturale: gli agenti possono concatenare in sequenza molte chiamate al modello — pianificazione, uso di strumenti, verifica dei risultati — quindi la latenza di ciascuna chiamata si accumula nell'ambito di un singolo compito.

Google ha rilasciato Gemini 3.7 Flash, il suo ultimo modello ottimizzato per la programmazione software e i flussi di lavoro aziendali autonomi. OpenAI ha aperto un'anteprima limitata di GPT-5.6 Sol Ultrafast, un nuovo livello di servizio che esegue il suo modello più potente fino a 750 token di output al secondo.

Today we're introducing Gemini 3.7 Flash, our most intelligent workhorse model yet for coding and agents. This model brings substantial gains across software engineering, web development, and complex knowledge work. Now through the end of the year, Gemini 3.7 Flash is available… pic.twitter.com/RSCBDipjKn

— Google (@Google) August 13, 2026 (X post)

Gemini 3.7 Flash è un modello in disponibilità generale. Accetta fino a un milione di token di input — circa 750.000 parole — e ne restituisce 64.000, gestendo testo, immagini, video, audio e PDF, oltre a poter richiamare strumenti e controllare un computer. Google lo propone come cervello economico per sistemi autonomi che pianificano attività e completano lavori in più fasi con meno aiuto umano.

Il modello non sacrifica la qualità alla velocità. È allo stesso tempo più capace e più efficiente, completando il compito di programmazione di test di Google in 2 minuti e 13 secondi, mentre l'ultimo modello Flash impiegava più di 5 minuti. Anche il divario qualitativo tra i due è evidente.

L'Ultrafast di OpenAI non è un modello nuovo. Si tratta di GPT-5.6 Sol — lo stesso modello che OpenAI ha fatto testare a un red team di IA per rafforarlo contro gli attacchi di prompt injection prima del lancio — su un binario più veloce, alimentato dal produttore di chip Cerebras. È circa 14 volte più veloce della velocità standard dello stesso GPT-5.6 Sol.

Previewing Ultrafast mode: GPT-5.6 Sol at up to 14x the speed. Launching first in the OpenAI API to a select group of customers with expanded access to more businesses as capacity grows. pic.twitter.com/a5dleofiDJ

— OpenAI (@OpenAI) August 13, 2026 (X post)

I chip wafer-scale di Cerebras (processori fabbricati con dimensioni prossime a quelle di un intero wafer di silicio, invece dei molti piccoli chip solitamente ricavati da uno) generano fino a 750 token al secondo — circa 560 parole — una velocità sufficiente perché un agente vocale possa ragionare durante una chiamata.

I numeri che contano

La scheda di benchmark di Google colloca Gemini 3.7 Flash davanti a Claude Sonnet 5, GPT-5.6 Terra e altri modelli in 11 delle 18 categorie testate, incluso un punteggio di 1.588 Elo al vertice di Code Arena per lo sviluppo web e il 30,4% su AutomationBench per i flussi di lavoro aziendali. Il tutto si basa sulla metodologia di Google, quindi il vantaggio va considerato un'affermazione dell'azienda.

Come ogni modello Gemini Flash, anche questo è economico. A 75 centesimi di dollaro per milione di token di input e 3,75 dollari per milione di token di output fino alla fine dell'anno, costa la metà della tariffa originale di Gemini 3.6 Flash. Quel prezzo introduttivo scade il 31 dicembre, poi raddoppia a 1,50 e 7,50 dollari — che resta comunque una cifra contenuta per un modello Google.

OpenAI non ha pubblicato punteggi comparativi diretti per Ultrafast al di là delle dichiarazioni dei clienti. L'ingegnere IA di Jane Street John Crepezzi ha affermato nell'annuncio di OpenAI che la velocità di Cerebras "enables different ways of using the models." Il responsabile di prodotto di Podium, Courtland Lykins, l'ha definita "invaluable in our voice stack," sostenendo che la velocità "completely changes the call experience." Il livello è per ora disponibile solo su invito.

La spinta sulla velocità arriva mentre i laboratori passano da "who's smartest" a "who's fast enough for agents." I tempi scelti da Google sono significativi. Il suo modello di punta, Gemini 3.5 Pro, è ancora assente, senza una data di rilascio comunicata, tre settimane dopo 3.6 Flash e pochi giorni dopo una riorganizzazione della leadership di DeepMind che ha accantonato Demis Hassabis a favore del vice Koray Kavukcuoglu. OpenAI, nel frattempo, prende in affitto la velocità di Cerebras invece di attendere il proprio stack.

Gemini 3.7 Flash è già attivo in più di 160 paesi; GPT-5.6 Sol Ultrafast resta disponibile solo su invito.