NieuwsMacroOpenAI's GPT-6 Astra behaalt als eerste perfecte score op Koreaanse CSAT met recordlaag tokenverbruik

OpenAI's GPT-6 Astra behaalt als eerste perfecte score op Koreaanse CSAT met recordlaag tokenverbruik

Auteur: The Korea Times Business·

Belangrijkste punten

  • OpenAI's GPT-6 Astra scoorde een perfecte 450 in de 2026 CSAT LLM Solution Log, als eerste model op alle geteste vakken.
  • Astra verbruikte 357.000 tokens, het laagste gerapporteerde totaal onder publiek beschikbare modellen, wat de inferentiekosten verlaagt ten opzichte van concurrenten.
  • OpenAI's GPT-5.6 eindigde met 448,5 punten op de tweede plaats, vóór GPT-5.4 met 448, Claude Fable 5.1 met 447,5 en Gemini 3.1 Pro met 445.
  • De efficiëntie van het model wordt toegeschreven aan een ontwerp dat context uit eerdere redeneerstappen vasthoudt, comprimeert en hergebruikt tijdens repetitieve taken.
  • Branchedeskundigen waarschuwen dat AI-capaciteiten moeten worden beoordeeld op open, praktijkgerichte probleemoplossing in plaats van uitsluitend op gestandaardiseerde examenuitslagen.
OpenAI's GPT-6 Astra behaalt als eerste perfecte score op Koreaanse CSAT met recordlaag tokenverbruik

OpenAI's nieuwste kunstmatig-intelligentiemodel heeft voor het eerst een perfecte score behaald op de College Scholastic Ability Test (CSAT), het Zuid-Koreaanse toelatingsexamen voor universiteiten, volgens een nieuw gepubliceerde analyse. Hoewel toonaangevende AI-modellen eerder bijna-perfecte resultaten behaalden, valt deze uitkomst vooral op omdat het model dit deed met een lager tokenverbruik dan zijn concurrenten — een metriek die commercieel van belang is, aangezien tokengebruik direct doorvertaalt naar inferentiekosten voor ontwikkelaars en bedrijven die deze modellen op grote schaal inzetten.

Resultaten die zondag op GitHub werden gepubliceerd, toonden aan dat OpenAI's nieuwe GPT-6 Astra het enige geëvalueerde model was dat een perfecte 450 scoorde in de 2026 CSAT LLM Solution Log. De evaluatie testte modellen op vragen uit de CSAT van 2026, over Koreaanse taal, Engels, wiskunde, Koreaanse geschiedenis en vier keuzevakken — Natuurkunde I, Scheikunde I, Biologie I en Samenleving en Cultuur — zonder internettoegang. De CSAT, een gestandaardiseerd examen dat jaarlijks door honderdduizenden Koreaanse studenten wordt afgelegd, is inmiddels een terugkerende maatstaf geworden om te vergelijken hoe goed frontier-modellen omgaan met meertalig, multi-vak redeneren onder examenomstandigheden.

Astra was het eerste AI-model dat in deze evaluatie op alle geteste vakken een perfecte score behaalde. In februari scoorde Google's Gemini 3.1 Pro nog perfect, maar nam toen slechts twee keuzevakken — Scheikunde I en Biologie I — en liet het onder het bredere formaat van deze evaluatie vragen missen bij Natuurkunde I en een maatschappijvak.

In de zondag gepubliceerde ranglijst eindigde OpenAI's GPT-5.6 met 448,5 punten op de tweede plaats, gevolgd door GPT-5.4 op drie met 448. Anthropic's Claude Fable 5.1 werd vierde met 447,5 en Gemini 3.1 Pro vijfde met 445.

GPT-6 Astra gebruikte 357.000 tokens, het laagste gerapporteerde totaal onder publiek beschikbare modellen. Ter vergelijking: GPT-5.6 gebruikte 429.000 tokens en Claude Fable 5.1 562.000. Omdat de examenvragen en -antwoorden publiek beschikbaar waren, kan eerdere blootstelling via trainingsdata niet worden uitgesloten, hoewel concurrenten als Claude Fable 5.1 en Gemini 3.1 Pro onder dezelfde omstandigheden werden getest.

De sterke prestatie in combinatie met het lagere tokenverbruik wordt toegeschreven aan een reasoning-gericht ontwerp dat context vasthoudt tijdens repetitieve taken. Een provider-adapterharness comprimeert en hergebruikt informatie uit eerdere redeneerstappen, waardoor de AI het examen aflegt op een manier die de aanpak van een topperende student nabootst.

Lee Seung-hyun, buitengewoon hoogleraar aan de Hanyang University, zei dat de kern niet enkel is dat het model slimmer is geworden, maar dat het eerdere redeneerstappen kan vasthouden, context kan comprimeren en zijn plan kan bijstellen. "Het betekent dat het model in plaats van elke keer opnieuw harder na te denken, doorging met wat het eerder al had uitgevogeld," aldus Lee.

OpenAI noemde het resultaat bemoedigend en benadrukte dat het model efficiënte verwerking bereikte met behulp van hyperschaal AI-computerinfrastructuur. Een woordvoerder van OpenAI zei dat de mijlpaal aantoont dat modellen krachtiger kunnen worden terwijl de prestaties verbeteren en de kosten dalen.

Branchedeskundigen waarschuwden echter dat het potentieel van een model moet worden afgemeten aan zijn vermogen om open probleemstellingen op te lossen, en niet uitsluitend aan gestandaardiseerde examenscores. Een insider uit de Koreaanse AI-sector zei dat het betekenisvoller zal zijn als AI echte uitdagingen op de werkvloer aankan, waar geen vooraf vastgestelde antwoorden bestaan. Hoe toonaangevende modellen presteren op bredere onafhankelijke benchmarks — en of concurrenten het efficiëntiegat dichten — zal uitwijzen of dit resultaat een duurzame verschuiving markeert in de afweging tussen kosten en prestaties.

Dit artikel is gebaseerd op een rapport van de Hankook Ilbo, de zusterpublicatie van The Korea Times, vertaald door een generatief AI-systeem en geredigeerd door The Korea Times. Originele bron: The Korea Times.