SpaceXAI di Elon Musk lancia Grok 4.7 con un punteggio DeepSWE del 71%
Punti chiave
- •SpaceXAI ha rilasciato Grok 4.7 il 21 settembre, descrivendolo come il suo modello più capace per programmazione e lavoro cognitivo, con un addestramento focalizzato su attività che richiedono diverse ore.
- •Il modello viene lanciato a 2 dollari per milione di token in ingresso e 6 dollari per milione in uscita, invariato rispetto a Grok 4.6 e ben al di sotto di GPT-5.6 Sol a 4/20 dollari e Fable 5.1 a 10/50 dollari.
- •Sui benchmark pubblicati da SpaceXAI, Grok 4.7 ha ottenuto il 71,0% su DeepSWE v1.1, ha portato Terminal-Bench 4.0 al 38,0% dal 20,3% del predecessore, ed è in testa su EEBench e sul benchmark Harvey per agenti legali, restando indietro rispetto a Fable 5.1 su CursorBench 4.0 e HealthBench Professional.
- •Una safety stack ricostruita ha bloccato tutto tranne il 3,3% dei prompt dual-use ad alto rischio in HackerBench v0.3, con pochi falsi rifiuti, e alcuni partner di cybersecurity hanno ricevuto un accesso-team solo su invito.
- •Pochi ore prima del lancio, le tre configurazioni di Grok 4.6 hanno perso contro ogni configurazione di Codex e Claude nel Brood War Bench di Ben Swerdlow, con un risultato migliore di 2 vittorie su 18 partite, e Grok 4.7 non è stato classificato.

Grok 4.7 è costruito per carichi di lavoro di più ore
SpaceXAI, l'unità di intelligenza artificiale di Elon Musk, ha rilasciato Grok 4.7 il 21 settembre, descrivendolo come il modello più capace dell'azienda per programmazione e lavoro cognitivo. Secondo l'annuncio ufficiale, il nuovo sistema si basa su un modello base più ampio rispetto a Grok 4.6 ed è passato per cicli di apprendimento per rinforzo più lunghi su combinazioni di attività più difficili, con un'attenzione deliberata ai problemi che richiedono diverse ore per essere completati.
L'azienda ha inquadrato il rilascio attorno alla resistenza. Laddove i modelli precedenti rispondevano in pochi minuti, Grok 4.7 è calibrato per affrontare compiti che terrebbero occupati per ore un ingegnere o un analista umano. SpaceXAI ha dichiarato che il modello è ora nettamente migliore nel verificare i propri output su sessioni lunghe, nella gestione di finestre di contesto molto ampie (la quantità di testo che un modello può tenere in vista operativa contemporaneamente) e nell'operare nativamente il framework agentico Grok Bot, il tipo di configurazione multi-step in cui un modello pianifica, richiama strumenti ed esegue il lavoro in autonomia invece di rispondere a un singolo prompt — aggiornamenti che, secondo l'azienda, si riflettono nella conversazione, nei compiti di conoscenza generale e nella generazione di documenti e presentazioni professionali.
Sui benchmark pubblicati, la configurazione xhigh si colloca vicino alla frontiera. Su DeepSWE v1.1, una suite di ingegneria del software, Grok 4.7 ha ottenuto il 71,0%, superando di poco Fable 5.1 max al 70,0% e restando dietro solo a GPT-5.6 Sol max al 72,7%. Su Terminal-Bench 4.0, che valuta lavoro da terminale di più ore, il modello è passato al 38,0% dal 20,3% del predecessore. Sulle suite che simulano mansioni professionali di più ore per avvocati, infermieri e analisti finanziari — tra cui AA Briefcase e HealthBench — SpaceXAI ha dichiarato chek 4.7 ora è al passo con i migliori del settore.
La sicurezza è l'altro dato di rilascio. Una safety stack ricostruita rende questa la versione più resistente dell'azienda nel rifiutare richieste improprie e opporsi ai jailbreak, ovvero i tentativi di spingere un modello oltre le sue salvaguardie. In HackerBench v0.3, che testa compiti informatici malevoli, solo il 3,3% dei prompt dual-use ad alto rischio — richieste con applicazioni sia legittime sia dannose — è passato, con pochi falsi rifiuti di lavoro di sicurezza difensiva legittimo. Alcuni partner di cybersecurity hanno ottenuto un accesso red-team solo su invito, test avversari in cui ricercatori di sicurezza analizzano un sistema alla ricerca di vulnerabilità, a supporto della ricerca difensiva.
Il modello è già disponibile tramite Cursor, Grok Build, l'API Grok, le principali piattaforme cloud e i model router, i servizi che inoltrano la richiesta di uno sviluppatore al modello AI scelto attraverso un'unica interfaccia.
Prezzi a 2 dollari confermati mentre il Brood War Bench mette in imbarazzo Grok 4.6
Il prezzo è la costante silenziosa: Grok 4.7 viene lanciato a 2 dollari per milione di token in ingresso e 6 dollari per milione di token in uscita — identico a Grok 4.6 — più una variante veloce che raddoppia la velocità di output al doppio del prezzo. I token sono le unità di testo che i modelli linguistici leggono e generano, e la fatturazione delle API è calcolata su di essi: l'ingresso copre ciò che lo sviluppatore invia, l'uscita ciò che il modello restituisce. Le tariffe scavalcano nettamente la concorrenza: GPT-5.6 Sol è listato a 4/20 dollari per milione di token e Fable 5.1 a 10/50 dollari, collocando i prezzi di Grok a circa un terzo o metà dei livelli dei rivali, con consegne più rapide.
La tabella comparativa dello stesso SpaceXAI mostra Grok 4.7 in testa nell'ingegneria elettrica (EEBench: 64,0% contro il 39,4% di GPT-5.6 Sol e il 56,4% di Fable 5.1) e nel benchmark Harvey per agenti legali (19,6% contro 2,5% e 6,7%), mentre resta indietro rispetto a Fable 5.1 nell'ingegneria del software (CursorBench 4.0: 46,3% contro 51,8%) e nel ragionamento clinico (HealthBench Professional: 56,7% contro 62,1%). Ogni cifra proviene dai dati pubblicati da SpaceXAI.
Il contesto societario conta: SpaceXAI ha assunto la sua forma attuale a febbraio, quando xAI si è fusa in SpaceX, seguita dall'acquisizione di Cursor a giugno, l'editor di codice AI che funge anche da uno dei canali di lancio di Grok 4.7 — parte dell'impero di Musk che comprende Tesla (TSLA) e, secondo precedenti ricostruzioni, una spinta a consolidare i piani di abbonamento AI entro poche settimane.
Pochi ore prima lancio, però, un benchmark crowdsourced ha messo in cattiva luce il predecessore. Il Brood War Bench dello sviluppatore Ben Swerdlow, in cui agenti AI giocano a StarCraft: Brood War, è circolato su X il 20 settembre: 19 configurazioni di Codex, Claude e Grok si sono sfidate in 171 partite uno contro uno, e Codex Astra ha vinto tutte le sue 18 partite al massimo del ragionamento. Le tre configurazioni di Grok 4.6 hanno perso contro ogni configurazione di Codex e Claude, con un risultato migliore di 2 vittorie su 18. La strategia in tempo reale è una prova impegnativa per gli agenti perché le decisioni su economia, produzione e combattimento arrivano in modo continuo — non c'è un turno in cui fermarsi e pianificare.
Swerdlow ha registrato una partita in cui una configurazione Grok al massimo del ragionamento ha consumato 11.138 token di ragionamento in 43 minuti emettendo però solo sei pacchetti di comandi — senza mai schierare una sola unità da combattimento. Ha scritto che Grok non è ancora abbastanza intelligente per il gioco, con i modelli più datati che trattano la strategia in tempo reale come a turni, e ha aggiunto che nessun concorrente ha superato il livello di principiante. Grok 4.7 non è stato classificato.
La lettura di COINOTAG: la pressione sui prezzi è il vero segnale
Prendendo insieme i numeri del giorno di lancio e i risultati del Brood War, il quadro è unico: i laboratori di frontiera ora vendono ragionamento a prezzi commodity, e l'affidabilità agentica — non i punteggi statici dei benchmark — decide chi vince. Nella valutazione di COINOTAG, il listino da 2/6 dollari dà a Grok 4.7 una tokenomics che i rivali dovranno eguagliare, proprio come i prezzi dei futures costringono i mercati a riposizionare le aspettative, mentre i laboratori senza capacità di calcolo comparabili rischiano di diventare exit liquidity in questa guerra dei prezzi. La testata ha aggiunto che i titoli di Musk sul calcolo storicamente hanno mosso il sentiment su asset legati a Musk come Dogecoin (DOGE), e ha consigliato di osservare i risultati agentici di Grok 4.7 piuttosto che le affermazioni del lancio.