xAI rilascia Grok 4.7 con nuove misure di sicurezza e prestazioni più alte nei task di più ore
Punti chiave
- •Grok 4.7 è costruito su una nuova base modello più ampia e addestrato con un prolungato ciclo di apprendimento per rinforzo su task più difficili, il che secondo xAI migliora la generazione di codice, la gestione di contesti lunghi e l'autoverifica.
- •I maggiori guadagni nei benchmark del modello sono arrivati nella programmazione e nel lavoro al terminale di lunga durata, con Terminal-Bench 4.0 salito al 38,0% dal 20,3% e CursorBench 4.0 salito al 46,3% dal 40,4%.
- •Grok 4.7 debutta con uno stack di sicurezza completamente nuovo, descritto da xAI come il più forte testato per comportamento di rifiuto e resistenza ai jailbreak, e guida il benchmark di biosicurezza di LatchBio al 62,4%.
- •I prezzi restano ai livelli di Grok 4.6: 2 dollari per milione di token di input e 6 dollari per milione di token di output, al di sotto delle tariffe di GPT-5.6 Sol e Fable 5.1.
- •Artificial Analysis ha assegnato a Grok 4.7 un punteggio di 46 sull'Intelligence Index, un guadagno di due punti che colloca SpaceXAI tra i primi quattro labor AI, ma ha rilevato che il modello ha usato circa 81.000 token di output per task, più del doppio dei 36.000 di Grok 4.6, aumentando i costi effettivi.

xAI ha rilasciato Grok 4.7, descrivendolo come il suo modello più capace fino a oggi per la programmazione e il lavoro cognitivo. L'azienda ha posizionato il modello come un'offerta frontier a un prezzo competitivo, con tariffe invariate rispetto al predecessore Grok 4.6.
Grok 4.7 è costruito su una nuova base modello più ampia ed è stato addestrato attraverso un prolungato ciclo di apprendimento per rinforzo utilizzando un mix di task più difficile, orientato verso problemi che richiedono molte ore per essere completati. Secondo xAI, le modifiche all'addestramento migliorano la generazione di codice, la gestione di contesti lunghi e l'autoverifica. Il modello comprende inoltre nativamente l'harness Grok Bot, il che, secondo l'azienda, lo rende più efficace nei task conversazionali e nel lavoro cognitivo generale.
I maggiori guadagni dichiarati si sono concentrati nei task di programmazione e terminal di lunga durata. Su CursorBench 4.0, Grok 4.7 ha ottenuto un punteggio del 46,3%, rispetto al 40,4% di Grok 4.6. Il suo punteggio ha superato il 41,7% di GPT-5.6 Sol ma è rimasto al di sotto del 51,8% di Fable 5.1. Ad alto sforzo su DeepSWE v1.1, Grok 4.7 ha ottenuto il 71,0%, sotto il 72,7% di GPT-5.6 Sol ma superando di poco il 70,0% di Fable 5.1.
Il modello è inoltre migliorato rispetto a Grok 4.6 su GDPval e AA Briefcase, che valuta task d'ufficio di più ore completati da professionisti come avvocati, infermieri e analisti finanziari. Su AA Briefcase, Grok 4.7 ha ottenuto 1.657, vicino al 1.678 di Fable 5.1. L'aumento più pronunciato nei benchmark èato su Terminal-Bench 4.0, che misura il lavoro al terminale di più ore: il punteggio di Grok 4.7 è salito dal 20,3% di Grok 4.6 al 38,0%.
Su HackerBench v0.3, che copre task informatici rischiosi, il modello ha lasciato passare solo il 3,3% dei prompt pericolosi a doppio uso, bloccando raramente il lavoro di sicurezza legittimo.
Grok 4.7 is here. It's a notable improvement over Grok 4.6 at the same price and speed. pic.twitter.com/H3OTBbXyvO — SpaceXAI (@SpaceXAI) September 21, 2026
https://x.com/SpaceXAI/status/2102069815225586149?ref_src=twsrc%5Etfw
Nuovo stack di sicurezza e prezzi invariati
Un elemento centrale del rilascio è lo stack di sicurezza di Grok 4.7, che xAI ha descritto come completamente nuovo e il più forte mai testato dall'azienda per comportamento di rifiuto e resistenza ai jailbreak. Il modello guida il benchmark di biosicurezza di LatchBio con un punteggio del 62,4%, coniugando le prestazioni sui task benigni con i rifiuti sulle richieste pericolose nei domini a doppio uso come la cybersecurity e la ricerca biologica. xAI ha inoltre iniziato a fornire ad alcuni partner di cybersecurity selezionati un accesso solo su invito alle capacità red team del modello per la ricerca difensiva.
Grok 4.7 è disponibile alle stesse tariffe di Grok 4.6: 2 dollari per milione di token di input e 6 dollari per milione di token di output. Queste tariffe sono inferiori ai prezzi di GPT-5.6 Sol, rispettivamente 4 e 20 dollari, e di Fable 5.1, 10 e 50 dollari. Una variante veloce con il doppio della velocità di output è disponibile al doppio del prezzo. Le tariffe flat per token rendono il confronto di listino semplice, sebbene il costo totale di un lavoro di lunga durata dipenda anche da quanti token un modello consuma per completare un task.
Sulla frontiera prezzo-prestazioni di CursorBench, i prezzi collocano Grok 4.7 tra le opzioni più convenienti per carichi di lavoro di programmazione estesi. Il modello è disponibile immediatamente in Cursor e Grok Build, nonché tramite la Grok API, harness di programmazione di terze parti, router di modelli e piattaforme cloud.
Il rilascio intensifica la concorrenza tra i fornitori di modelli frontier, che confrontano sempre più i sistemi su task agentici di lunga durata, calibrazione della sicurezza e costo per task completato, oltre ai punteggi dei benchmark. Per sviluppatori e imprese che valutano modelli orientati alla programmazione, Grok 4.7 unisce prezzi stabili a punteggi più alti nei task di più ore e nuove misure di sicurezza.
Artificial Analysis conferma i guadagni ma segnala il consumo di token
Anche la società di benchmark indipendente Artificial Analysis ha valutato Grok 4.7, assegnandogli un punteggio di 46 sull'Intelligence Index. Si tratta di due punti in più rispetto a Grok 4.6, e ha collocato SpaceXAI tra i primi quattro laboratori AI, secondo la società. La valutazione esterna coincide con il posizionamento di xAI del rilascio come un passo avanti nella programmazione e nel lavoro cognitivo.
La valutazione ha utilizzato uno sforzo di ragionamento xhigh e ha individuato il progresso chiaro nel lavoro cognitivo agentico di lungo orizzonte. Sul benchmark privato AA-Briefcase di Artificial Analysis, Grok 4.7 ha guadagnato 111 punti Elo rispetto al predecessore, raggiungendo 1.657 e collocandosi accanto a Claude Opus 5 e Claude Fable 5.1 alla frontiera. L'aumento è stato trainato principalmente dalla qualità analitica, salita a 1.994 Elo da 1.690. La qualità della presentazione è rimasta pressoché stabile.
Su GDPval-AA, che misura prodotti di lavoro pratici come documenti, fogli di calcolo e slide, Grok 4.7 ha ottenuto 1.695 Elo, con un aumento di 90 punti.
Grok 4.7 scores 46 on the Artificial Analysis Intelligence Index to bring SpaceXAI into the top 4 AI labs. Coding Agent Index performance has also improved, overtaking GPT-5.6 Sol Grok 4.7 scores +2 points over Grok 4.6 on the Intelligence Index, with strong performance on… pic.twitter.com/8p4KC6cgZy — Artificial Analysis (@ArtificialAnlys) September 21, 2026
https://x.com/ArtificialAnlys/status/2102074898327932987?ref_src=twsrc%5Etfw
Artificial Analysis ha rilevato che i miglioramenti delle prestazioni hanno richiesto un consumo di calcolo notevolmente superiore. A sforzo xhigh, Grok 4.7 ha utilizzato circa 81.000 token di output per task dell'Intelligence Index, più del doppio dei 36.000 token usati da Grok 4.6 e quasi il triplo dei 27.000 token consumati da GPT-6 Astra al massimo sforzo. Poiché le tariffe per token sono invariate, questo consumo più elevato aumenta il costo effettivo di un task comparabile, anche se i prezzi di listino sono rimasti invariati.
La società ha riportato ulteriori miglioramenti modesti su Terminal-Bench 4.0 e GDP.pdf, insieme a piccole regressioni su AA-LCR e AutomationBench-AA. L'affidabilità è migliorata in modo contenuto: il tasso di allucinazioni su AA-Omniscience è sceso al 29% dal 34%, mentre l'accuratezza è rimasta quasi invariata al 47%.
Le altre specifiche tecniche restano le stesse della generazione precedente, inclusa una finestra di contesto invariata di 500.000 token. Il prezzo per cache hit è scontato a 0,50 dollari per milione di token. Con il modello attivo su Cursor, Grok Build, la Grok API, harness di terze parti, router di modelli e piattaforme cloud, gli sviluppatori possono ora valutare i guadagni nei benchmark rispetto al maggiore consumo di token sui propri carichi di lavoro. Il rapporto originale è disponibile su Metaverse Post.