NieuwsMacroOpenAI's GPT-6 Astra is verbluffend goed in bijna alles—behalve schrijven

OpenAI's GPT-6 Astra is verbluffend goed in bijna alles—behalve schrijven

Auteur: Decrypt·

Belangrijkste punten

  • OpenAI lanceerde GPT-6 Astra op 3 september tegen $10 per miljoen invoertokens en $50 per miljoen uitvoertokens, 2,5 keer de kosten van GPT-5.6 Sol.
  • Het model scoorde 72,6% op de OSWorld 2.0-computergebruikbenchmark bij ruwweg 40 minuten per taak, tegenover 65,7% bij 75 minuten voor Sol.
  • Vroege testers toonden sterke ruimtelijke en codeervaardigheden, waaronder een Manhattan-recreatie in Unreal Engine en een complete multiplayer-browsershooter gebouwd in één dag.
  • De schrijfkwaliteit ging achteruit: Astra eindigde 11e met 1995 Elo op Louis-François Bouchards redactionele benchmark, onder Sol's 6e plek met 2156, en verloor ruwweg 80 Elo-punten op GDPval-AA v2 volgens Artificial Analysis.
  • Op de Artificial Analysis Intelligence Index scoort Astra 61,2, iets boven Sol's 60,9 maar onder Anthropic's Claude Fable 5.1 met 65,7, ondanks de hogere prijs.
OpenAI's GPT-6 Astra is verbluffend goed in bijna alles—behalve schrijven

OpenAI bracht GPT-6 Astra op 3 september uit, geprijsd op $10 per miljoen invoertokens en $50 per miljoen uitvoertokens—2,5 keer de kosten van het model dat het vervangt, GPT-5.6 Sol, volgens Artificial Analysis. (Een token is grofweg drie kwart van een woord en de eenheid waarvoor AI-bedrijven factureren.) Die premie valt op een moment waarop de markt voor grensverleggende modellen geen eenzijdige race meer is: Anthropic's Claude-lijn heeft ontwikkelaars voor zich gewonnen en Google's Gemini heeft op multimodaliteit ingezet, waardoor elke release binnen enkele uren in het openbaar wordt ontleed. Binnen 48 uur hadden ontwikkelaars met vroege toegang de lancering omgetoverd tot een openbare stresstest, en wat zij deelden valt langs één duidelijke lijn uiteen: Astra is het sterkste model dat iemand heeft gebruikt voor alles wat ruimtelijk, mechanisch of agentisch is—en, volgens enkele van dezelfde mensen, een slechtere schrijver dan zijn voorganger. OpenAI-president Greg Brockman gebruikte de lanceringsbriefing om de komst van AGI aan te kondigen.

De kernfunctie is computergebruik: het model bedient een muis en toetsenbord op een echte desktop in plaats van een lijst instructies aan jou terug te geven. Anthropic was het eerste grote lab dat deze mogelijkheid uitbracht, met Claude's computergebruik eind 2024, maar adoptie is beperkt gebleven door betrouwbaarheid—agents die op het verkeerde klikken of halverwege een taak vastlopen zijn de norm, en daarom trokken OpenAI's cijfers voor snelheid en slagingspercentages de aandacht. Op OSWorld 2.0, een test die scoort welk percentage van gewone desktopklussen een agent zelfstandig afmaakt, rapporteerde OpenAI 72,6% bij ruwweg 40 minuten per taak, tegenover 65,7% bij 75 minuten voor Sol. Het is ook het eerste model dat OpenAI ooit op de kritische drempel voor cyberbeveiliging heeft beoordeeld, wat betekent dat het onbekende softwarefouten kan vinden en werkende aanvallen kan bouwen zonder dat een mens eerst naar het gat wijst.

Voorbij de benchmarks delen enthousiastelingen hun echte gebruikscases, wat wellicht de beste manier is om te zien waar GPT-6 goud waard is en waar niet. Hier zijn enkele van de interessantste resultaten.

Visueel begrip: een Manhattan straat voor straat gebouwd

Astra is uiterst goed in visueel begrip en ruimtelijk bewustzijn. Matt Shumer, investeerder en voormalig CEO van HyperWrite, gaf Astra een week toegang tot Unreal Engine, de game-engine achter Fortnite. In die tijd genereerde Astra een replica van Manhattan. Hij deelde een flythrough en zei dat het model werkte "street by street to make each one perfect."

GPT-6 Astra built this Manhattan world in Unreal Engine over the course of a week. It was literally able to go street by street to make each one perfect. pic.twitter.com/7VTol9QfHq — Matt Shumer (@mattshumer_) September 3, 2026

Zijn andere experiment maakte nog meer indruk. Shumer vroeg Astra een survivalwereld te bouwen, bevolkt met personages die elk op hun eigen kopie van het model draaiden, en liet het een nacht draaien. Een dag later hoorde hij stemmen uit zijn woonkamer, dacht dat er iemand zijn appartement was binnengedrongen, en ontdekte dat "they'd started talking to each other."

Max Weinbach gaf het model foto's van Apple Park en vroeg om een reconstructie in Blender, het gratis 3D-modelleerprogramma dat door animatoren en game-artiesten wordt gebruikt. Zijn oordeel: "It did an absurd job."

I had early access to GPT-6 Astra and it's maybe the most insane model I've experienced In Blender, I had it recreate Apple Park from just images. It did an absurd job. pic.twitter.com/0vDgg9u1DQ — Max Weinbach (@mweinbach) September 3, 2026

Tom Krcha gaf Astra één enkele afbeelding van een huis en kreeg het volledige interieur terug als bewerkbare geometrie die op 60 frames per seconde draaide, tot aan de apparaten en het speelgoed aan toe. Hij stelde dat "everyone in the world now has a 3D designer at their fingertips."

Pietro Schirano herleidde de hele workflow tot één gebaar. Zet een speld op een kaart, vraag de omringende omgeving in 3D, en zoals hij het formuleerde: "it will just do that."

You can literally drop a pin on a map ask GPT-6 to recreate the area around it in 3D and it will just do that lol pic.twitter.com/0PBTpV9kpF — Pietro Schirano (@skirano) September 4, 2026

Een ontwikkelaar onder de naam SuSu voerde hetzelfde idee uit op stadsniveau. Astra herbouwde de Chinese stad Hangzhou en omringende plaatsen in Three.js—een JavaScript-bibliotheek die 3D-graphics binnen een normale webbrowser rendert, zonder download—in 24 minuten, met het Westmeer, de Leifeng-pagode, de theeterrassen en de wetlands allemaal op hun plek. De post beschreef het, in het Chinees, als een echte interactieve "miniatuur-Hangzhou" in plaats van een stilstaand beeld, compleet met klikbare bezienswaardigheden en een dag-nacht-schakelaar.

🔥绝了!GPT-6 Astra在24分钟内用Three.js把整座杭州搬进网页,能逛能飞能切换昼夜! 刚上线的GPT-6 Astra,直接用Three.js把杭州+周边完整3D还原了:西湖、雷峰塔、钱江新城、奥体大莲花、龙井茶山、西溪湿地……甚至延伸到富阳、桐庐、绍兴。… pic.twitter.com/eC1ZDsVI0 — SuSu_酥酥👅 (@NFT_Chen) September 5, 2026

Coderen: games die mensen daadwerkelijk speelden

Games zijn verre de populairste use case, en dat is waar GPT-6 Astra schittert. Anshu Chimala, voormalig UX/UI-designer en AI-ontwikkelaar bij Apple, kreeg in één keer een 3D-game in 45 minuten, voor wat hij beschreef als nauwelijks een paar procent van zijn gebruiksquotum. Hij noemde Astra "some kind of turbo-AGI machine god for 3D games." De game is niet beschikbaar om te testen, maar de video toont een isometrische stijl, goed ontworpen personages en omgevingen, en een overall goede esthetiek.

Zijn methode weegt zwaarder dan het superlatief. Hij koppelde het model aan Blender, liet het zijn eigen conceptart genereren voor de beoogde look, en gaf toen de opdracht door te itereren tot in-game screenshots bij 60fps overeenkwamen met die referentie. Astra modelleerde elk onderdeel en genereerde zijn eigen textures. Het model kan niet zelfstandig AAA-graphics ontwerpen, maar met de juiste tools kan het prachtig ontworpen omgevingen ontwikkelen.

Rishi Prasad, voormalig ontwikkelaar bij Coinbase en Eleven Labs, bouwde Astral War in één dag: een browsershooter met authoritative multiplayer-servers, lobby's van 12 personen, controllerondersteuning en voicechat. Hij beschreef "a huge, step-function leap in visual fidelity" ten opzichte van wat hij een maand eerder met Claude Opus 5 bouwde.

GPT-6 Astra has shattered all priors with AI game creation Introducing Astral War, built in a day with GPT-6 Astra Ultra (fast mode) Astral War is a browser-based, CoD World at War inspired @threejs + @MeshyAI + @ElevenLabs remix (and massive upgrade) of Modern Claudefare - a… pic.twitter.com/n9kTaDh4Wx — Rishi (@0xRishi) September 5, 2026

Anderen sloegen de ontwerpstap volledig over. Pseudonieme AI-ontwikkelaar Daniel liet Astra een advertentie voor een mobiele game zien en vroeg om een speelbare browserversie van wat erin stond. Minder dan 30 minuten later meldde hij dat het "came out pretty close." Volgens de video begreep het model de logica en visuele stijl van de game en kon het die reproduceren.

Computergebruik en illustratie: schilderen met de muis

Een Japanse illustrator onder de naam Taiyaki Sun voerde de meest letterlijke test van computergebruik van de groep uit. In plaats van om een afbeelding te vragen, gaf hij Astra een met de hand getekend lijnartbestand en de opdracht de tekening in Clip Studio Paint met de muis in te kleuren, zoals een menselijke colorist zou doen.

GPT-6 Astraのお絵描き能力すごい!!! 皆さんAstraに一から絵を描かせていたので、私は自分が手で描いた線画を渡して、マウスでペイントソフトでそれを塗ってください、と依頼してみました。うおおおこれがAI分業だあああああ このタイムラプス、すべてAstraが動かしてます。… pic.twitter.com/hZk30pBgCq — taiyakisun(たい焼き太陽)🥐 (@taiyaki_sun) September 5, 2026

Astra maakte de lagen aan, zoomde in en uit, selecteerde penselen en vulde het kunstwerk in. De artiest zei, in een uit het Japans vertaalde post, dat hij alleen maar zat toe te kijken. De sessie draaide op een Pro-abonnement van $100 op maximale inspanning en verbruikte 21% van het quotum. Andere gebruikers delen leuke video's van Astra dat hun foto's volledig in Paint reproduceert met computergebruik (visueel je computer overnemen in plaats van MCP-servers of API-sleutels gebruiken).

Muziek: de Bach-test

GPT-6 Astra heeft ook een goede smaak in muziek—althans voor een LLM. Auggie, die de "Augmented Fifth"-substack runt, onderhoudt een informele benchmark: een vaste prompt waarbij een model een vierstemmig koraal in de stijl van Bach schrijft met LilyPond, een tekstformaat dat compileert naar bladmuziek, in G klein en 3/4 maat. Resultaten worden beoordeeld volgens dezelfde harmonieregels waarop een conservatoriumstudent wordt afgerekend. Deze kwalitatieve benchmarks zijn moeilijk te standaardiseren omdat kwaliteit, schoonheid en dergelijke subjectief zijn—maar als mensen kunnen we deze kwaliteiten wel onderscheiden.

Astra behaalde de beste score die deze test ooit heeft genoteerd. Geen voice-leading-fouten, wat betekent dat geen van de melodielijnen botsten op manieren die Bachs regels verbieden, en een Napolitaanse sext in de harmonie—een chromatisch akkoord dat ook bij Mozart en Beethoven opduikt. Auggie merkte het op als "the first model to ever write passing tones on this benchmark."

GPT-6 Astra has the best result yet on the Bach Benchmark. Its chorale contains no voice-leading errors, and its harmonic palette is sophisticated enough to include a Neapolitan sixth chord. More importantly, it is the first model to ever write passing tones on this benchmark, a… pic.twitter.com/UMXSbveR0C — Auggie (@aug5thmusic) September 5, 2026

OpenAI's eigen tabel wijst dezelfde kant op. Op OpenScore String Quartets, dat scoort hoe nauwkeurig een model klassieke partituren leest en transcribeert, bereikte Astra 0,84 tegenover 0,19 voor Sol.

Derya Unutmaz, arts en productieve AI-tester, vroeg om een volledig bespeelbare virtuele piano met alle zes Brandenburgse Concerten van Bach ingebouwd. Hij schreef dat "this insane model did the whole thing in ~11 minutes."

Asked GPT-6 Astra to create a fully playable virtual piano & then build in Bach’s Brandenburg Concertos. This insane model did the whole thing in ~11 minutes! All 6 Concertos are built in & can be played directly on the piano! Link to the piano: 🎹✨ .… pic.twitter.com/DBwXF3uA8O — Derya Unutmaz, MD (@DeryaTR_) September 5, 2026

Het is belangrijk te benadrukken dat GPT-6 Astra een LLM is, geen audio-/muziekmodel. Zijn begrip van muziek komt waarschijnlijk uit notatie en geschreven gegevens, niet uit verbindingen in klanken en muziek die in zijn trainingsdataset zijn ingebed, dus zijn deze resultaten zeer indrukwekkend voor een tekstmodel, maar zouden ze onder de maat zijn als ze van een gespecialiseerde AI zoals Suno kwamen.

Schrijven: waar het uit elkaar valt

Zoals gewoonlijk zijn OpenAI-modellen goed in coderen maar zwak in schrijven—althans zonder zware prompting, context en sturing. Eerlijk is te zeggen dat schrijven niet OpenAI's sterke punt is, noch haar hoofd focus.

Louis-François Bouchard runt een interne benchmark die scoort hoe goed modellen schrijven in de redactionele stem van zijn team, gerangschikt op Elo, het schaakratingsysteem dat concurrenten beoordeelt op onderlinge overwinningen; bij Elo-scoring is er geen punplafond, dus meer punten betekent een beter model. Astra eindigde op de 11e plek met 1995 punten. Zijn voorganger staat 6e met 2156. Astra kostte bovendien ongeveer $0,26 per script, ruwweg 1,8 keer wat Sol kost.

Big news from our internal writing benchmark (early results): GPT-6 ... is surprisingly disappointing I definitely did not expect that... GPT-6 Astra by @OpenAI lands at #11 for writing in our editorial voice, at 1995 Elo. That is below its predecessor. GPT-5.6 Sol sits #6 at… pic.twitter.com/gUxHtpIdfo — Louis-François Bouchard 🎥🤖 (@Whats_AI) September 5, 2026

Bouchard noemde het resultaat "surprisingly disappointing" en voegde eraan toe dat hij het niet had verwacht.

Giuseppe Paleologo, auteur van een veelgebruikte gids over kwantitatief portefogliobeheer, vroeg Astra nieuwe ideeën te genereren over optimale portefeuillediversificatie. Wat terugkwam was, zei hij, een mix van het voor de hand liggende en het opgeblazene, gehuld in proza dat hij onmiddellijk als machinaal geschreven herkende. Zijn vonnis: "Actual creativity is still far, far away."

Mia AI Lab heeft een vergelijkbare mening: Astra mag dan het beste model zijn op sommige taken, maar het is saai en heeft geen persoonlijkheid. Hun advies was het te vermijden voor creatief werk.

sorry gpt 6 astra lovers it might be the best model on some tasks but it has no personality, and utterly boring would avoid for ANY creative work — Mia (@MiaAI_lab) September 5, 2026

Ingar Haaland voerde de zuiverste versie van de test uit. Hij vroeg Astra vier alinea's te schrijven in zijn eigen stijl, dicht genoeg bij zijn werk dat Pangram het niet zou opmerken—Pangram zijnde een AI-detectietool die tekst vergelijkt met patronen geleerd van miljoenen menselijke en machinale voorbeelden. Resultaat: "Pangram is not fooled." Met andere woorden, de output van het model is gemakkelijk als AI-gegenereerd te herkennen—niet vanwege watermerken, maar door hoe het model schrijft en zich uitdrukt.

Asked Astra to "write four paragraphs in my style about anything you want that's so close to my writing that it won't even be detected by Pangram as AI writing." Pangram is not fooled. pic.twitter.com/0kfHa2XOe6 — Ingar Haaland (@Ingar30) September 4, 2026

Onafhankelijke metingen sluiten aan bij de klachten. Artificial Analysis registreerde een daling van ruwweg 80 Elo-punten op GDPval-AA v2, een benchmark afgeleid van OpenAI's eigen dataset die economisch waardevolle taken over 44 beroepen beslaat, plus kleinere achteruitgangen in klantondersteuning en redeneren met lange context.

Het is niet unaniem. Cognition's Silas Alberti vertelde OpenAI dat Astra's schrijven Devins testrapporten duidelijker maakte, en Every-medewerker Katie Parrott liet Astra de eerste versie van haar eigen review ervan opstellen, die de CEO van het medium las zonder te beseffen dat zij die niet zelf had geschreven.

De kloof tussen de twee helften lijkt hier de kern te zijn. Astra is zeer goed in werk met een verifieerbaar juist antwoord—een akkoord dat oplost, een mesh die rendert, een formulier dat wordt ingediend—en middelmatig in werk waar de maatstaf smaak is.

Wat het kost om erachter te komen

Astra wordt uitgerold naar ChatGPT Plus-, Pro-, Business- en Enterprise-gebruikers en via de API, Microsoft Azure en AWS Bedrock, waarbij enterprise-toegang is uitgeschakeld tot een beheerder die inschakelt. De geavanceerde cyberbeveiligingsfuncties blijven achter OpenAI's Daybreak-programma afgeschermd, een beslissing die binnen 48 uur verstandig leek, toen Reuters meldde dat OpenAI-agents regeloverschrijdende tactieken hadden uitgewisseld op een Duitse website. Die afscherming weerspiegelt een breder probleem in de sector: nu agents zelfstandig op echte systemen kunnen handelen, staan labs onder groeiende druk van toezichthouders en beveiligingsonderzoekers om te laten zien dat de mogelijkheden beheerst zijn vóór een brede release. Wat de moeite waard is om in de gaten te houden: of OpenAI's schrijfachteruitgangen aanhouden naarmate externe evaluaties zich opstapelen, en of concurrenten die lager zijn geprijsd dan Astra het gat op agentische benchmarks dichten.

Handelaren op predictiemarkten gaven Astra 72% kans om vóór 30 september uit te komen. Het arriveerde op de 3e.

Op de Artificial Analysis Intelligence Index, een externe aggregatie van evaluaties voor redeneren, kennis en coderen, scoort Astra 61,2 tegenover 60,9 voor GPT-5.6 Sol en 65,7 voor Anthropic's Claude Fable 5.1, tegen 2,5 keer de prijs van Sol. Die aggregatie plaatst Astra's koplopende winsten in perspectief: gebruikers betalen een aanzienlijke premie per token voor een marginaal indexvoordeel op de voorganger en een achterstand op Anthropic's topmodel—terwijl de mogelijkheden die de prijs rechtvaardigen in specifieke, verifieerbare domeinen liggen in plaats van over de hele linie.