xAI lancia Grok 4.7 dopo ripetuti rinvii, ma resta indietro rispetto ai rivali di frontiera nei benchmark
Punti chiave
- •Grok 4.7 utilizza 2,1 trilioni di parametri, un aumento del 40% rispetto agli 1,5 trilioni di Grok 4.6, ed è prezzato a 2 dollari per milione di token di input e 6 dollari per milione di token di output.
- •xAI ha integrato nell'addestramento del modello dati di SpaceX, tra cui telemetria satellitare Starlink, registri di produzione e log di guasti ingegneristici, puntando a migliorare il ragionamento su hardware e sistemi fisici.
- •I primi risultati dei benchmark collocano Grok 4.7 al secondo posto dietro Claude Fable 5.1 su GDPval (1695 contro 1735) e AA-Briefcase (1657 contro 1678), e dietro GPT-6 Astra sul test di ingegneria elettrica EEBench.
- •Il lancio è arrivato dopo almeno cinque tempistiche di rilascio riviste da fine luglio, e il modello è andato online immediatamente, senza lista d'attesa, nell'app Grok, su Cursor, Grok Build e tramite l'API di xAI.
- •Musk ha dichiarato che Grok 4.7 dovrebbe collocarsi più o meno alla pari del Claude Opus 5.0 di Anthropic, e ha delineato i prossimi modelli—Grok 4.8, Grok 4.9 e un eventuale Grok 5 leader di frontiera—senza assegnare date di rilascio.

xAI di Elon Musk ha rilasciato Grok 4.7 lunedì pomeriggio, il suo modello più capace fino a oggi, definito dall'azienda "un miglioramento significativo rispetto a Grok 4.6 allo stesso prezzo e alla stessa velocità."
I primi risultati dei benchmark hanno collocato il modello al secondo posto dietro Claude Fable 5.1 su GDPval e AA-Briefcase, e dietro GPT-6 Astra su EEBench, un benchmark di ingegneria elettrica.
Il lancio è arrivato dopo una serie di scadenze mancate. Musk ha rimandato indietro la tempistica di rilascio almeno cinque volte da fine luglio: prima "tra quattro settimane", poi "poche settimane", poi "3 o 4 settimane", poi "10 giorni" il 1° settembre e infine "ha bisogno di qualche giorno in più per cuocersi" l'11 settembre.
Questa volta non c'è lista d'attesa. Grok 4.7 è disponibile immediatamente nell'app Grok, su Cursor, Grok Build e tramite l'API di xAI.
Musk è poi intervenuto su X, definendo Grok 4.7 "una forte combinazione di intelligenza, velocità e basso costo."
Grok 4.7 is here. It's a notable improvement over Grok 4.6 at the same price and speed. pic.twitter.com/H3OTBbXyvO
Secondo l'annuncio ufficiale di xAI, il modello impiega più tempo per risolvere problemi complessi e ricontrolla le proprie risposte più spesso rispetto a Grok 4.6, oltre a disporre di quanto l'azienda definisce i suoi più solidi guardrail di sicurezza fino a oggi.
Scala, prezzi e dati di SpaceX
Grok 4.7 integra 2,1 trilioni di parametri, un aumento del 40% rispetto agli 1,5 trilioni di Grok 4.6, che era a sua volta un perfezionamento di Grok 4.5. I costi sono fissati a 2 dollari per milione di di input e 6 dollari per milione di token di output. I parametri sono le manopole interne che un modello regola durante l'addestramento, e un numero maggiore di essi significa generalmente una maggiore capacità di apprendere pattern, mentre i token sono le unità basiche di informazione che un modello di IA può registrare o generare.
xAI ha inoltre incorporato dati di addestramento supplementari provenienti da SpaceX, l'azienda spaziale di Musk: telemetria satellitare Starlink, registri di produzione e log di guasti ingegneristici. La proposta è un modello che ragiona meglio su hardware e sistemi fisici rispetto a qualsiasi modello addestrato esclusivamente su testo proveniente da internet.
I benchmark raccontano una storia familiare
GDPval misura le prestazioni di un modello su lavoro intellettuale reale ed economicamente prezioso—promemoria legali, fogli di calcolo, presentazioni—utilizzando compiti verificati da professionisti attivi in ciascun settore, e assegna un punteggio sotto forma di rating Elo, lo stesso sistema di classificazione head-to-head usato negli scacchi. Grok 4.7 ha raggiunto 1695 su GDPval, mentre Claude Fable 5.1 ha guidato la classifica con 1735—un divario di 40 punti sulla scala Elo.
AA-Briefcase, creato da Artificial Analysis, verifica lavori d'ufficio della durata di diverse ore che concatenano ricerca, analisi e produzione di documenti in un unico compito lungo, anch'esso valutato sulla scala Elo. Grok 4.7 ha ottenuto 1657 contro il 1678 di Fable 5.1—un divario più ristretto di 21 punti, e lo stesso risultato su un test diverso.
CursorBench 4.0, il benchmark di Cursor per compiti di programmazione reali all'interno del suo editor, mette in relazione l'accuratezza con il costo e il numero di token consumati da ciascun compito. Grok 4.7 si colloca a metà: più costoso per compito rispetto a GPT-6 Astra, il successore di GPT-5.6 Sol, e Claude Sonnet 5, ma comunque sotto Fable 5.1, che vince a ogni fascia di prezzo della classifica.
Uno schema ricorrente per xAI
L'azienda ha ripetutamente lanciato modelli di punta arrivati alle spalle dei rivali nelle valutazioni indipendenti. Grok 4.5 ha debuttato a luglio con il più grande cluster di addestramento del settore e punteggi al terzo posto dietro i modelli di Claude e OpenAI. Prima di esso, Grok 4.20 aveva sacrificato l'affidabilità in cambio di velocità e personalità, e Grok 4.6 era rimasto indietro rispetto al gruppo di frontiera nell'autonomia di programmazione.
Tutto ciò non rende Grok 4.7 un prodotto scarso per i milioni di persone che vi interagiscono tramite X, l'app dedicata o il cruscotto della loro Tesla. Significa però che il modello più probabile per rispondere alle domande degli utenti—o alimentare l'assistente vocale della loro auto—si basa su un sistema che i benchmark del suo stesso produttore collocano un gradino sotto la cima della classifica.
Questo divario spiega perché, per la maggior parte delle persone, il prezzo conta più della posizione in classifica. xAI ha costant praticato prezzi per token inferiori rispetto ad Anthropic e OpenAI pur restando indietro nelle capacità pure, scommettendo che "abbastanza buono, economico e ovunque" batta "il migliore, ma più caro" per la maggior parte dell'uso quotidiano.
Le aspettative di Musk e la strada da percorrere
Musk aveva già abbassato le aspettative pochi giorni prima del lancio, scrivendo su X che Grok 4.7 dovrebbe collocarsi "più o meno alla pari" del Claude Opus 5.0 di Anthropic—non del più recente Opus 5.1—con prestazioni multimodali ancora da migliorare.
Nello stesso post ha delineato i prossimi tre modelli: Grok 4.8 come un passo avanti significativo, Grok 4.9 in "classe Astra/Fable", e Grok 5 come possibile leader di frontiera. Questi aggiornamenti non hanno ancora una data di rilascio—un dettaglio che assume un peso maggiore considerando che la stessa tempistica di Grok 4.7 è stata rimandata almeno cinque volte prima del lancio. "Vedremo", ha scritto.