NotizieMacroGPT-6 Astra di OpenAI ottiene il primo punteggio perfetto al test d'ingresso universitario coreano con un numero record di token ridotto

GPT-6 Astra di OpenAI ottiene il primo punteggio perfetto al test d'ingresso universitario coreano con un numero record di token ridotto

Autore: The Korea Times Business·

Punti chiave

  • GPT-6 Astra di OpenAI ha ottenuto un punteggio perfetto di 450 nel 2026 CSAT LLM Solution Log, il primo modello a riuscirci in tutte le materie testate.
  • Astra ha consumato 357.000 token, il totale più basso riferito tra i modelli disponibili pubblicamente, riducendo i costi di inferenza rispetto ai rivali.
  • GPT-5.6 di OpenAI si è classificato secondo con 448,5 punti, davanti a GPT-5.4 con 448, Claude Fable 5.1 con 447,5 e Gemini 3.1 Pro con 445.
  • L'efficienza del modello è attribuita a un progetto che conserva, comprime e riutilizza il contesto dei passaggi di ragionamento precedenti durante i compiti ripetitivi.
  • Gli esperti del settore avvertono che le capacità dell'AI dovrebbero essere giudicate sulla risoluzione di problemi aperti e reali, non solo sui risultati di esami standardizzati.
GPT-6 Astra di OpenAI ottiene il primo punteggio perfetto al test d'ingresso universitario coreano con un numero record di token ridotto

L'ultimo modello di intelligenza artificiale di OpenAI ha ottenuto per la prima volta un punteggio perfetto al College Scholastic Ability Test (CSAT), il test d'ingresso universitario della Corea del Sud, secondo una nuova analisi pubblicata. Mentre i modelli AI di punta in passato avevano raggiunto risultati quasi perfetti, questo esito desta particolare attenzione perché il modello lo ha conseguito consumando meno token dei rivali — una metrica rilevante a livello commerciale, poiché l'utilizzo di token si traduce direttamente nei costi di inferenza per gli sviluppatori e le imprese che eseguono questi modelli su larga scala.

I risultati pubblicati domenica su GitHub hanno mostrato che il nuovo GPT-6 Astra di OpenAI è stato l'unico modello valutato a raggiungere il punteggio perfetto di 450 nel 2026 CSAT LLM Solution Log. La valutazione ha testato i modelli su domande del CSAT 2026 comprendenti lingua coreana, inglese, matematica, storia coreana e quattro materie facoltative — Fisica I, Chimica I, Scienze della vita I e Società e cultura — senza accesso a internet. Il CSAT, un esame standardizzato sostenuto ogni anno da centinaia di migliaia di studenti coreani, è diventato un punto di riferimento ricorrente per confrontare la capacità dei modelli di frontiera di gestire ragionamenti multilingue e multimateria in condizioni d'esame.

Astra è stato il primo modello AI a conseguire un punteggio perfetto in tutte le materie testate nella valutazione. A febbraio, Gemini 3.1 Pro di Google aveva ottenuto un punteggio perfetto sostenendo solo due materie facoltative — Chimica I e Scienze della vita I — ma aveva sbagliato domande in Fisica I e in una materia di studi sociali nel formato più ampio usato in questa valutazione.

Nella classifica pubblicata domenica, GPT-5.6 di OpenAI si è classificato secondo con 448,5 punti, seguito da GPT-5.4 al terzo posto con 448. Claude Fable 5.1 di Anthropic si è piazzato quarto con 447,5, e Gemini 3.1 Pro quinto con 445.

GPT-6 Astra ha utilizzato 357.000 token, il totale più basso mai riferito tra i modelli disponibili pubblicamente. A titolo di confronto, GPT-5.6 ha usato 429.000 token e Claude Fable 5.1 562.000. Poiché le domande e le risposte dell'esame erano disponibili pubblicamente, il risultato non può escludere una precedente esposizione tramite i dati di addestramento, sebbene i modelli concorrenti come Claude Fable 5.1 e Gemini 3.1 Pro abbiano affrontato le stesse condizioni.

Le forti prestazioni del modello, unite al minore utilizzo di token, sono attribuite a un progetto legato al ragionamento che conserva il contesto durante i compiti ripetitivi. Un provider adapter harness comprime e riutilizza le informazioni dei passaggi di ragionamento precedenti, consentendo all'AI di svolgere il test in modo che riprende l'approccio di uno studente con il punteggio più alto.

Lee Seung-hyun, professore a contratto presso l'Università Hanyang, ha affermato che la chiave non è semplicemente che il modello è diventato più intelligente, ma che può conservare i passaggi di ragionamento precedenti, comprimere il contesto e rivedere il proprio piano. «Significa che, invece di ragionare più intensamente ogni volta, ha proseguito con ciò che aveva già capito in precedenza», ha detto Lee.

OpenAI ha descritto il risultato come incoraggiante, evidenziando che il modello ha ottenuto un'elaborazione efficiente utilizzando infrastrutture di calcolo AI su iperscala. Un responsabile di OpenAI ha affermato che questo traguardo dimostra che i modelli possono diventare più potenti migliorando al contempo le prestazioni e riducendo i costi.

Gli esperti del settore hanno tuttavia avvertito che il potenziale di un modello dovrebbe essere valutato in base alla sua capacità di risolvere problemi aperti anziché solo in base ai punteggi di esami standardizzati. Un addetto del settore AI coreano ha dichiarato che sarà più significativo se l'AI saprà affrontare sfide reali sul posto di lavoro, dove non esistono risposte predeterminate. Le prestazioni dei modelli leader su benchmark indipendenti più ampi — e se i rivali colmeranno il divario di efficienza — mostreranno se questo risultato segna un cambiamento duraturo nel compromesso tra costi e prestazioni.

Questo articolo si basa su un report di Hankook Ilbo, pubblicazione gemella di The Korea Times, tradotto da un sistema di AI generativa e redatto da The Korea Times. Fonte originale: The Korea Times.