NieuwsAandelenGebruikers van GPT-6 Astra zeggen dat OpenAI's nieuwste model is 'verzwakt'

Gebruikers van GPT-6 Astra zeggen dat OpenAI's nieuwste model is 'verzwakt'

Auteur: Decrypt·

Belangrijkste punten

  • Somm gebruikers melden dat GPT-6 Astra nu snellere antwoorden van lagere kwaliteit geeft, en ontwikkelaar Pankaj Kumar vermoedt dat OpenAI de rekeninspanning van het model heeft verlaagd, een wijziging die het bedrijf niet heeft bevestigd.
  • Salio en onderzoeker Md Ismail Sojal zeiden identieke prompts met dezelfde instellingen te hebben gedraaid op launchdag en op de huidige versie, en beiden meldden slechtere resultaten van het huidige model.
  • Dax Raad's Opencode-team schakelde terug naar GPT-5.6 Sol nadat de uitgaven waren verdubbeld, en concludeerde dat de nadelen van Astra de premium prijs niet waard waren.
  • Critici waaronder Antikythera en T3Chat-oprichter Theo betogen dat het model niet is veranderd en dat het wegebben van de lanceringsshype langdurige inconsistenties blootlegt.
  • Astra blijft OpenAI's eerste model dat de kritieke drempel voor cybersecurityrisico overschrijdt en is geprijsd op $10 per miljoen inputtokens en $50 per miljoen outputtokens, 2,5 keer wat Sol bij de lancering vroeg.
Gebruikers van GPT-6 Astra zeggen dat OpenAI's nieuwste model is 'verzwakt'

Gebruikers overspoelen X met klachten dat OpenAI's GPT-6 Astra slechts een week na de lancering minder capabel is geworden. Sommige gebruikers melden snellere antwoorden met slechtere resultaten, terwijl anderen betogen dat het model altijd al inconsistent was en dat de aanvankelijke opwinding de zwakke punten simpelweg verborg.

Een week geleden bouwde GPT-6 Astra Manhattan straat voor straat opnieuw op binnen een game-engine en imponpeerde gebruikers met zijn mogelijkheden. Deze week plaatsen een deel van dezelfde gebruikers screenshots en vragen aan OpenAI wat er met het model is gebeurd.

Astra feels significantly dumber for me today”, schreef de pseudonieme ontwikkelaar synthwavedd op X. “Was only a matter of time before The Post-Launch Lobotomy. Shame.”

Het patroon is gebruikers van AI-chatbots en -agenten goed bekend: soms heeft men het gevoel dat een favoriet model na de release “nerfed” is — een term uit de gamingwereld die beschrijft dat ontwikkelaars iets wat te sterk was verzwakken. Er kunnen redelijke verklaringen zijn voor waargenomen prestatieverminderingen, maar het aantal vergelijkbare klachten over GPT-6 Astra heeft gebruikers aangezet om outputs te vergelijken en te onderzoeken of het model is veranderd. De vraag is praktisch relevant voor ontwikkelaars die producten bouwen op modellen die ze huren in plaats van zelf draaien, en omdat gesloten systemen geen inzage in de interne werking bieden, zijn vergelijkingen van outputs naast elkaar een van de weinige verificemiddelen die buitenstaanders hebben.

Ontwikkelaar Pranjal Paliwal, die Astra eerder had geprezen, zei later de door het model geschreven code te hebben bekeken en zijn oordeel te hebben bijgesteld.

We don't have AGI”, schreef Paliwal. “We have a regression.”

AGI, of artificial general intelligence, is de term uit de sector voor een machine die in wezen elke cognitieve taak kan uitvoeren die een mens kan uitvoeren. OpenAI's president gebruikte de term bij de lancering van Astra. Een week later gebruikte Paliwal hem om de kloof tussen de schijnbare mogelijkheden van het model en zijn fouten te beschrijven.

Andere klachten volgen een vergelijkbaar patroon. Ontwikkelaar Pankaj Kumar somde snellere antwoorden en lagere kwaliteit op als symptomen, samen met het vermoeden dat OpenAI “the juice value” had verlaagd. Oprichter Saba vroeg OpenAI ook rechtstreeks waarom ze taken nu eerst moest “vereenvoudigen” om ze gedaan te krijgen.

“Juice value” is geen officiële technische term. In deze context gebruiken gebruikers het als verzamelbegrip voor de rekeninspanning die een model aanlegt voordat het antwoordt, en voor het vermoeden dat OpenAI die inspanning na de lanceringsshowcases mogelijk heeft teruggedraaid. OpenAI heeft niet bevestigd dat het een dergelijke wijziging aan Astra heeft doorgevoerd.

Sommige gebruikers hebben directe vergelijkingen uitgevoerd. Salio en onderzoeker Md Ismail Sojal zeiden identieke prompts te hebben gedraaid op Astra op launchdag en opnieuw op de huidige versie, met dezelfde instellingen. Beiden meldden slechtere resultaten van het huidige model.

Today's GPT-6 Astra output looks worse. GPT-6 Astra at launch vs GPT-6 Astra today”, schreef Sojal. De post vermeldde dat de vergelijking dezelfde prompt en instellingen gebruikte en dat “[t]he difference is bigger than I expected.”

Andere gebruikers zeggen dat ze zijn teruggeschakeld naar Astra's voorganger. Dax Raad, die de codeertool Opencode bouwt, zei dat zijn team is teruggekeerd naar GPT-5.6 Sol omdat de uitgaven waren verdubbeld terwijl de nadelen van Astra de kosten niet waard waren. ChatGPT-gebruiker Mustafa Sahinli vergeleek Astra met Claude Opus 4.6 “after 1 week of release”, een verwijzing naar de terugslag die Anthropic's model eveneens na de lancering kreeg.

Niet iedereen gelooft dat OpenAI Astra opzettelijk heeft verzwakt. De pseudonieme gebruiker Antikythera bracht een gedetailleerd weerwoord naar voren en betoogde dat de tijdlijn mogelijk andersom loopt.

It is as dumb as it was on launch”, schreef Antikythera. “The model good, but the model has a lot of problems. It's lazy. Writes like a bullet-point-addict... people were overhyped on launch week, now they had time to test it and see its mistakes.”

Volgens die verklaring is Astra niet minder capabel geworden; gebruikers raakten simpelweg niet langer onder de indruk van de vroege demonstraties en begonnen de terugkerende problemen op te merken.

Theo, oprichter van T3Chat, had een vergelijkbare kijk. Hij zei dat Astra inconsistenter is dan Claude Fable en zowel uitzonderlijk goede als extreem slechte code kan produceren.

GPT-6 Astra has done incredible things I never thought a model could do. It has also done some of the stupidest things I've ever seen a model do. Generally speaking, Fable 5.1 just does what I ask”, schreef Theo op 8 september 2026 op X. De toename van negatieve voorbeelden weerspiegelt volgens hem mogelijk het einde van de aanvankelijke huwelijksreis van het model, in plaats van een bevestigde gedragsverandering.

Het debat weerspiegelt gebeurtenissen rond OpenAI's vorige vlaggenschipmodel, GPT-5.6 Sol. In juli zeiden gebruikers dat Sol's hoogste redeneermodus plotseling minder grondig was geworden. OpenAI-topman Tibo Sottiaux ontkende het model opzettelijk te hebben verzwakt, maar bevestigde dat het bedrijf had geëxperimenteerd met “reasoning effort”, een instelling die bepaalt hoeveel stappen een model doorloopt voordat het een antwoord produceert.

Eén antwoord vatte de terugkerende grap over gesloten AI-laboratoria samen: een bedrijf brengt een model uit, en enkele dagen later krijgt het “some kind of disease a few days later and suddenly become[s] dumber.” Een andere gebruiker bood een cynischere verklaring in één zin: “They probably get quantized so they're not burning the companies as much money.”

Kwantisatie verlaagt de precisie van de interne berekeningen van een model om computerkosten te drukken, vaak ten koste van nauwkeurigheid. OpenAI heeft nooit bevestigd een uitgebracht model opzettelijk te hebben gekwantiseerd.

OpenAI heeft nog geen Sol-achtige verklaring over Astra afgegeven. In juli leidde een vergelijkbare golf van klachten over Sol tot een officiële reactie van een topman; of OpenAI de klachten over Astra op dezelfde manier zal behandelen, is een open vraag. Het model blijft het eerste van het bedrijf dat de door OpenAI zo genoemde kritieke drempel voor cybersecurityrisico overschrijdt. Die aanduiding betekent dat Astra eerder onbekende softwarekwetsbaarheden kan vinden en aan elkaar kan ketenen zonder menselijke begeleiding, een mogelijkheid die via OpenAI's Daybreak-programma is voorbehouden aan gecontroleerde verdedigers.

Ongeacht of Astra minder capabel is geworden, de vermelde prijs blijft $10 per miljoen inputtokens en $50 per miljoen outputtokens — 2,5 keer wat Sol bij de lancering vroeg, een premie die ten minste één team al niet meer waard achtte.