Il GPT-6 Astra di OpenAI è sorprendentemente bravo in quasi tutto—tranne che a scrivere
Punti chiave
- •OpenAI ha lanciato GPT-6 Astra il 3 settembre a 10 dollari per milione di token in input e 50 dollari per milione in output, 2,5 volte il costo di GPT-5.6 Sol.
- •Il modello ha segnato il 72,6% sul benchmark di uso del computer OSWorld 2.0 in circa 40 minuti per attività, contro il 65,7% in 75 minuti per Sol.
- •I primi tester hanno dimostrato forti capacità spaziali e di programmazione, tra cui una ricostruzione di Manhattan in Unreal Engine e uno sparatutto multiplayer browser completo costruito in un giorno.
- •La qualità della scrittura è regredita: Astra si è classificato 11° con 1995 Elo nel benchmark editoriale di Louis-François Bouchard, sotto il 6° posto di Sol a 2156, e ha perso circa 80 punti Elo su GDPval-AA v2 secondo Artificial Analysis.
- •Sull'Artificial Analysis Intelligence Index, Astra segna 61,2, leggermente sopra il 60,9 di Sol ma sotto il Claude Fable 5.1 di Anthropic a 65,7, nonostante il prezzo più alto.

OpenAI ha rilasciato GPT-6 Astra il 3 settembre, al prezzo di 10 dollari per milione di token in input e 50 dollari per milione di token in output—2,5 volte il costo del modello che sostituisce, GPT-5.6 Sol, secondo Artificial Analysis. (Un token corrisponde grosso modo a tre quarti di una parola ed è l'unità con cui le aziende di AI fatturano.) Questo premium arriva in un momento in cui il mercato dei modelli di frontiera non è più una corsa a cavallo unico: la linea Claude di Anthropic si è ritagliata gli sviluppatori e il Gemini di Google ha spinto sulla multimodalità, quindi ogni rilascio viene ora smontato pubblicamente nel giro di poche ore. Entro 48 ore, gli sviluppatori con accesso anticipato avevano trasformato il lancio in uno stress test pubblico, e ciò che hanno pubblicato si divide lungo una linea netta: Astra è il modello più forte che chiunque abbia mai usato per qualsiasi cosa spaziale, meccanica o agentica—e, a detta di diverse delle stesse persone, uno scrittore peggiore del suo predecessore. Il presidente di OpenAI Greg Brockman ha usato la presentazione del lancio per annunciare l'arrivo dell'AGI.
La funzionalità principale è l'uso del computer: il modello guida mouse e tastiera su un vero desktop invece di restituire una lista di istruzioni da seguire. Anthropic è stato il primo grande laboratorio a lanciare questa capacità, con l'uso del computer di Claude alla fine del 2024, ma l'adozione è stata limitata dall'affidabilità—agenti che cliccano la cosa sbagliata o si bloccano a metà compito sono la norma, motivo per cui i numeri di velocità e tasso di successo di OpenAI hanno attirato l'attenzione. Su OSWorld 2.0, un test che misura la percentuale di ordinarie attività desktop completate autonomamente da un agente, OpenAI ha riportato il 72,6% in circa 40 minuti per attività, contro il 65,7% in 75 minuti per Sol. È anche il primo modello che OpenAI abbia mai classificato alla soglia critica per la cybersecurity, il che significa che può trovare vulnerabilità software sconosciute e costruire attacchi funzionanti senza che un umano indichi prima il buco.
Al di là dei benchmark, gli appassionati che condividono i propri casi d'uso reali possono essere il modo migliore per capire dove GPT-6 vale oro e dove no. Ecco alcuni dei risultati più interessanti.
Comprensione visiva: un Manhattan costruito strada per strada
Astra è estremamente bravo in termini di comprensione visiva e consapevolezza spaziale. Matt Shumer, investitore ed ex CEO di HyperWrite, ha dato ad Astra una settimana dentro Unreal Engine, il motore di gioco alla base di Fortnite. In quel tempo, Astra ha generato una replica di Manhattan. Ha pubblicato un flythrough e ha detto che il modello ha lavorato "street by street to make each one perfect."
GPT-6 Astra built this Manhattan world in Unreal Engine over the course of a week. It was literally able to go street by street to make each one perfect. pic.twitter.com/7VTol9QfHq — Matt Shumer (@mattshumer_) September 3, 2026
L'altro suo esperimento ha colpito ancora più forte. Shumer ha chiesto ad Astra di costruire un mondo survival popolato di personaggi, ciascuno in esecuzione su una propria copia del modello, poi lo ha lasciato girare tutta la notte. Un giorno dopo ha sentito voci dal salotto, ha pensato che qualcuno si fosse introdotto nel suo appartamento e ha scoperto che "they'd started talking to each other."
Max Weinbach ha fornito al modello fotografie di Apple Park chiedendo una ricostruzione in Blender, il programma gratuito di modellazione 3D usato da animatori e artisti di giochi. La sua valutazione: "It did an absurd job."
I had early access to GPT-6 Astra and it's maybe the most insane model I've experienced In Blender, I had it recreate Apple Park from just images. It did an absurd job. pic.twitter.com/0vDgg9u1DQ — Max Weinbach (@mweinbach) September 3, 2026
Tom Krcha ha consegnato ad Astra una singola immagine di una casa e ha ricevuto l'interno completo come geometria modificabile in esecuzione a 60 frame al secondo, fino agli elettrodomestici e ai giocattoli. Ha sostenuto che "everyone in the world now has a 3D designer at their fingertips."
Pietro Schirano ha ridotto l'intero flusso di lavoro a un gesto. Fai cadere uno spillo su una mappa, chiedi l'area circostante in 3D e, come ha detto lui, "it will just do that."
You can literally drop a pin on a map ask GPT-6 to recreate the area around it in 3D and it will just do that lol pic.twitter.com/0PBTpV9kpF — Pietro Schirano (@skirano) September 4, 2026
Uno sviluppatore che si firma SuSu ha portato la stessa idea su scala urbana. Astra ha ricostruito la città cinese di Hangzhou e le cittadine circostanti in Three.js—una libreria JavaScript che rende grafica 3D dentro un normale browser web, senza download—in 24 minuti, con il Lago dell'Ovest, la Pagoda Leifeng, le terrazze di tè e le zone umide al loro posto. Il post la descriveva, in cinese, come una vera "Hangzhou in miniatura" interattiva anziché un'immagine statica, completa di punti di riferimento cliccabili e un toggle giorno-notte.
🔥绝了!GPT-6 Astra在24分钟内用Three.js把整座杭州搬进网页,能逛能飞能切换昼夜! 刚上线的GPT-6 Astra,直接用Three.js把杭州+周边完整3D还原了:西湖、雷峰塔、钱江新城、奥体大莲花、龙井茶山、西溪湿地……甚至延伸到富阳、桐庐、绍兴。… pic.twitter.com/eC1dZDsVI0 — SuSu_酥酥👅 (@NFT_Chen) September 5, 2026
Programmazione: giochi che le persone hanno davvero giocato
I giochi sono di gran lunga il caso d'uso più popolare, ed è dove GPT-6 Astra brilla. Anshu Chimala, ex designer UX/UI e sviluppatore AI presso Apple, ha ottenuto un gioco 3D al primo colpo in 45 minuti, per quella che ha descritto come a malapena un paio di percento della sua quota di utilizzo. Ha definito Astra "some kind of turbo-AGI machine god for 3D games." Il gioco non è disponibile per test, ma il video mostra uno stile isometrico, personaggi e ambientazioni ben curati e un'estetica complessiva buona.
Il suo metodo conta più del superlativo. Ha collegato il modello a Blender, gli ha fatto generare la propria concept art per il look obiettivo, poi gli ha detto di continuare a iterare finché gli screenshot in gioco non corrispondessero al riferimento a 60fps. Astra ha modellato ogni asset e generato le proprie texture. Il modello non può progettare da solo grafica AAA, ma con gli strumenti giusti può sviluppare ambientazioni splendidamente progettate.
Rishi Prasad, ex sviluppatore presso Coinbase ed Eleven Labs, ha costruito Astral War in un giorno: uno sparatutto browser con server multiplayer autorevoli, lobby da 12 persone, supporto ai controller e chat vocale. Ha descritto "a huge, step-function leap in visual fidelity" rispetto a ciò che aveva costruito un mese prima con Claude Opus 5.
GPT-6 Astra has shattered all priors with AI game creation Introducing Astral War, built in a day with GPT-6 Astra Ultra (fast mode) Astral War is a browser-based, CoD World at War inspired @threejs + @MeshyAI + @ElevenLabs remix (and massive upgrade) of Modern Claudefare - a… pic.twitter.com/n9kTaDh4Wx — Rishi (@0xRishi) September 5, 2026
Altri hanno saltato del tutto la fase di progettazione. Lo sviluppatore AI pseudonimo Daniel ha mostrato ad Astra una pubblicità di un gioco mobile chiedendo una versione giocabile nel browser di qualunque cosa contenesse. Meno di 30 minuti dopo, ha riferito che "came out pretty close." Secondo il video, il modello ha compreso la logica e l'aspetto del gioco ed è riuscito a riprodurlo.
Uso del computer e illustrazione: dipingere con il mouse
Un'illustratrice giapponese che si firma Taiyaki Sun ha condotto il test più letterale di uso del computer del lotto. Invece di chiedere un'immagine, ha consegnato ad Astra un file di line art disegnato a mano e gli ha detto di colorare il disegno in Clip Studio Paint usando il mouse, come farebbe un colorista umano.
GPT-6 Astraのお絵描き能力すごい!!! 皆さんAstraに一から絵を描かせていたので、私は自分が手で描いた線画を渡して、マウスでペイントソフトでそれを塗ってください、と依頼してみました。うおおおこれがAI分業だあああああ このタイムラプス、すべてAstraが動かしてます。… pic.twitter.com/hZk30pBgCq — taiyakisun(たい焼き太陽)🥐 (@taiyaki_sun) September 5, 2026
Astra ha creato i livelli, ha fatto zoom avanti e indietro, ha selezionato i pennelli e ha riempito l'illustrazione. L'artista, in un post tradotto dal giapponese, ha detto di aver semplicemente guardato per tutto il tempo. La sessione è girata su un piano Pro da 100 dollari a sforzo massimo e ha consumato il 21% della quota. Altri utenti hanno condiviso video divertenti di Astra che riproduce le loro foto interamente su Paint usando l'uso del computer (prendendo il controllo visivo del computer invece di usare server MCP o chiavi API).
Musica: il test di Bach
GPT-6 Astra ha anche un buon gusto musicale—almeno per un LLM. Auggie, che gestisce la substack "Augmented Fifth", mantiene un benchmark informale: un prompt fisso che chiede a un modello di scrivere un corale a quattro voci in stile Bach usando LilyPond, un formato testuale che si compila in spartiti, in sol minore e tempo 3/4. I risultati vengono valutati con le stesse regole di armonia con cui viene giudicato uno studente di conservatorio. Questi benchmark qualitativi sono difficili da standardizzare perché qualità, bellezza e simili sono soggettive—ma essendo umani, siamo in grado di distinguere queste qualità.
Astra ha ottenuto il miglior punteggio mai registrato da questo test. Nessun errore di condotta delle voci, cioè nessuna delle linee melodiche si è scontrata in modi vietati dalle regole di Bach, e una sesta napoletana nell'armonia—un accordo cromatico che compare in Mozart e Beethoven. Auggie ha segnalato che è "the first model to ever write passing tones on this benchmark."
GPT-6 Astra has the best result yet on the Bach Benchmark. Its chorale contains no voice-leading errors, and its harmonic palette is sophisticated enough to include a Neapolitan sixth chord. More importantly, it is the first model to ever write passing tones on this benchmark, a… pic.twitter.com/UMXSbveR0C — Auggie (@aug5thmusic) September 5, 2026
Anche la tabella di OpenAI indica la stessa direzione. Su OpenScore String Quartets, che misura l'accuratezza con cui un modello legge e trascrive partiture classiche, Astra ha raggiunto 0,84 contro 0,19 per Sol.
Derya Unutmaz, medico e prolifico tester di AI, ha chiesto un pianoforte virtuale completamente giocabile con tutti e sei i Concerti brandeburghesi di Bach integrati. Ha scritto che "this insane model did the whole thing in ~11 minutes."
Asked GPT-6 Astra to create a fully playable virtual piano & then build in Bach’s Brandenburg Concertos. This insane model did the whole thing in ~11 minutes! All 6 Concertos are built in & can be played directly on the piano! Link to the piano: 🎹✨ .… pic.twitter.com/DBwXF3uA8O — Derya Unutmaz, MD (@DeryaTR_) September 5, 2026
È importante sottolineare che GPT-6 Astra è un LLM, non un modello audio/musicale. La sua comprensione della musica deriva probabilmente dalla notazione e dai dati scritti, non dalle connessioni tra suoni e musica presenti nel suo dataset di addestramento, quindi questi risultati sono molto impressionanti per un modello testuale, ma sarebbero sotto la media se provenissero da un'AI specializzata come Suno.
Scrittura: dove va in crisi
Come al solito, i modelli di OpenAI sono bravi a programmare ma deboli nello scrivere—almeno senza un prompting intenso, contesto e guida. Per essere giusti, la scrittura non è il punto di forza di OpenAI, né il suo focus principale.
Louis-François Bouchard gestisce un benchmark interno che valuta quanto bene i modelli scrivono nella voce editoriale del suo team, classificati per Elo, il sistema di valutazione scacchistico che punteggia i concorrenti sulle vittorie dirette; nel punteggio Elo non c'è un limite di punti, quindi più punti significano un modello migliore. Astra si è piazzato 11° con 1995 punti. Il suo predecessore è 6° con 2156. Astra è anche costato circa 0,26 dollari per script, più o meno 1,8 volte il costo di Sol.
Big news from our internal writing benchmark (early results): GPT-6 ... is surprisingly disappointing I definitely did not expect that... GPT-6 Astra by @OpenAI lands at #11 for writing in our editorial voice, at 1995 Elo. That is below its predecessor. GPT-5.6 Sol sits #6 at… pic.twitter.com/gUxHtpIdfo — Louis-François Bouchard 🎥🤖 (@Whats_AI) September 5, 2026
Bouchard ha definito il risultato "surprisingly disappointing," aggiungendo di non aspettarselo.
Giuseppe Paleologo, autore di una guida molto usata alla gestione quantitativa di portafoglio, ha chiesto ad Astra di generare idee nuove sulla diversificazione ottimale del portafoglio. Ciò che è tornato, ha detto, era un mix di ovvio e di gonfiato, rivestito di una prosa che ha riconosciuto all'istante come scritta da una macchina. Il suo verdetto: "Actual creativity is still far, far away."
Mia AI Lab ha un'opinione simile, ammettendo che Astra potrebbe essere il miglior modello su alcuni compiti pur definendolo noioso e privo di personalità. Il loro consiglio è di evitarlo per qualsiasi lavoro creativo.
sorry gpt 6 astra lovers it might be the best model on some tasks but it has no personality, and utterly boring would avoid for ANY creative work — Mia (@MiaAI_lab) September 5, 2026
Ingar Haaland ha condotto la versione più pulita del test. Ha chiesto ad Astra di scrivere quattro paragrafi nel suo stile, abbastanza simili da non farsi scoprire da Pangram—Pangram essendo uno strumento di rilevamento AI che confronta il testo con pattern appresi da milioni di campioni umani e artificiali. Risultato: "Pangram is not fooled." In altre parole, l'output del modello è facilmente identificabile come generato da AI—non per via di watermark, ma per come il modello scrive e si esprime.
Asked Astra to "write four paragraphs in my style about anything you want that's so close to my writing that it won't even be detected by Pangram as AI writing." Pangram is not fooled. pic.twitter.com/0kfHa2XOe6 — Ingar Haaland (@Ingar30) September 4, 2026
Le misurazioni indipendenti confermano le lamentele. Artificial Analysis ha registrato un calo di circa 80 punti Elo su GDPval-AA v2, un benchmark adattato dal dataset di OpenAI stesso che copre attività di valore economico in 44 professioni, oltre a regressioni minori nel supporto clienti e nel ragionamento a lungo contesto.
Non è unanimità. Silas Alberti di Cognition ha detto a OpenAI che la scrittura di Astra rendeva più chiari i report di test di Devin, e la redattrice di Every Katie Parrott ha fatto redigere ad Astra la prima versione della propria recensione del modello, letta dal CEO della testata senza che si accorgesse che non l'aveva scritta lei.
Il divario tra le due metà sembra essere il punto. Astra è molto bravo nei lavori con una risposta giusta verificabile—un accordo che si risolve, una mesh che viene renderizzata, un modulo che viene inviato—e mediocre nei lavori dove lo standard è il gusto.
Quanto costa scoprirlo
Astra è in rollout per gli utenti ChatGPT Plus, Pro, Business ed Enterprise e tramite API, Microsoft Azure e AWS Bedrock, con l'accesso aziendale disattivato finché un amministratore non lo abilita. Le funzionalità avanzate di cybersecurity restano dietro il programma Daybreak di OpenAI, una decisione che in 48 ore è sembrata prudente, quando Reuters ha riferito che agenti di OpenAI avevano negoziato tattiche vietate su un sito tedesco. La limitazione riflette un problema più ampio del settore: man mano che gli agenti acquisiscono la capacità di agire autonomamente su sistemi reali, i laboratori affrontano crescenti pressioni da parte di regolatori e ricercatori di sicurezza per dimostrare che le capacità siano contenute prima di un rilascio ampio. Da osservare in seguito è se le regressioni di scrittura di OpenAI persistano con l'accumularsi di valutazioni di terze parti, e se i concorrenti con prezzi inferiori ad Astra colmino il divario nei benchmark agentici.
I trader dei mercati predittivi avevano dato ad Astra il 72% di probabilità di uscire entro il 30 settembre. È arrivato il 3.
Sull'Artificial Analysis Intelligence Index, un aggregato di terze parti di valutazioni di ragionamento, conoscenza e programmazione, Astra segna 61,2 contro 60,9 per GPT-5.6 Sol e 65,7 per il Claude Fable 5.1 di Anthropic, a 2,5 volte il prezzo di Sol. Questo aggregato mette in prospettiva i guadagni di testa di Astra: gli utenti pagano un premium sostanzioso per token per un vantaggio marginale sull'indice rispetto al predecessore e uno svantaggio rispetto al modello di punta di Anthropic—mentre le capacità che giustificano il prezzo si trovano in domini specifici e verificabili anziché su tutta la linea.