AktualnościMakroGPT-6 Astra OpenAI jako pierwszy model AI uzyskał maksymalny wynik na koreańskim egzaminie CSAT przy rekordowo niskim zużyciu tokenów

GPT-6 Astra OpenAI jako pierwszy model AI uzyskał maksymalny wynik na koreańskim egzaminie CSAT przy rekordowo niskim zużyciu tokenów

Autor: The Korea Times Business·

Najważniejsze informacje

  • GPT-6 Astra OpenAI zdobył komplet 450 punktów w rankingu 2026 CSAT LLM Solution Log jako pierwszy model we wszystkich testowanych przedmiotach.
  • Astra zużył 357 000 tokenów — najmniej spośród publicznie dostępnych modeli — co obniża koszty wnioskowania względem konkurentów.
  • GPT-5.6 OpenAI zajął drugie miejsce z 448,5 punktu, przed GPT-5.4 z 448, Claude Fable 5.1 z 447,5 i Gemini 3.1 Pro z 445.
  • Efektywność modelu przypisuje się konstrukcji, która zachowuje, kompresuje i ponownie wykorzystuje kontekst z wcześniejszych kroków rozumowania podczas zadań powtarzalnych.
  • Eksperci branżowi przestrzegają, że możliwości AI należy oceniać na podstawie otwartych, rzeczywistych problemów, a nie samych wyników standaryzowanych egzaminów.
GPT-6 Astra OpenAI jako pierwszy model AI uzyskał maksymalny wynik na koreańskim egzaminie CSAT przy rekordowo niskim zużyciu tokenów

Najnowszy model sztucznej inteligencji OpenAI po raz pierwszy uzyskał maksymalny wynik w południowokoreańskim College Scholastic Ability Test (CSAT), jak wynika z nowo opublikowanej analizy. Choć czołowe modele AI wcześniej osiągały niemal perfekcyjne rezultaty, ten wynik przyciąga szczególną uwagę, ponieważ model osiągnął go przy mniejszym zużyciu tokenów niż konkurenci — wskaźniku o znaczeniu komercyjnym, ponieważ zużycie tokenów przekłada się bezpośrednio na koszty wnioskowania dla deweloperów i przedsiębiorstw skalujących te modele.

Wyniki opublikowane w niedzielę na GitHubie wykazały, że nowy GPT-6 Astra OpenAI był jedynym ocenianym modelem, który zdobył komplet 450 punktów w rankingu 2026 CSAT LLM Solution Log. Ocena obejmowała pytania z CSAT 2026 z języka koreańskiego, angielskiego, matematyki, historii Korei oraz czterech przedmiotów do wyboru — fizyki I, chemii I, nauk o życiu I oraz społeczeństwa i kultury — bez dostępu do internetu. CSAT, standaryzowany egzamin zdawany co roku przez setki tysięcy koreańskich uczniów, stał się powracającym punktem odniesienia dla porównywania, jak dobrze najnowocześniejsze modele radzą sobie z wielojęzycznym, wieloprzedmiotowym rozumowaniem w warunkach egzaminacyjnych.

Astra był pierwszym modelem AI, który osiągnął maksymalny wynik we wszystkich testowanych przedmiotach w tej ocenie. W lutym Gemini 3.1 Pro Google uzyskał pełny wynik, zdając jedynie dwa przedmioty do wyboru — chemię I i nauki o życiu I — ale w szerszym formacie zastosowanym w tej ocenie nie odpowiedział poprawnie na pytania z fizyki I oraz przedmiotu z zakresu nauk społecznych.

W opublikowanym w niedzielę rankingu GPT-5.6 OpenAI zajął drugie miejsce z 448,5 punktu, a GPT-5.4 trzecie z 448 punktami. Claude Fable 5.1 Anthropic był czwarty z wynikiem 447,5, a Gemini 3.1 Pro uplasował się na piątej pozycji z 445 punktami.

GPT-6 Astra wykorzystał 357 000 tokenów — najniższy odnotowany wynik spośród publicznie dostępnych modeli. Dla porównania, GPT-5.6 zużył 429 000 tokenów, a Claude Fable 5.1 — 562 000. Ponieważ pytania i odpowiedzi egzaminacyjne były publicznie dostępne, wyniku nie można uznać za wolny od możliwego wcześniejszego kontaktu poprzez dane treningowe, choć konkurencyjne modele, takie jak Claude Fable 5.1 i Gemini 3.1 Pro, działały w tych samych warunkach.

Wysoką wydajność modelu w połączeniu z niższym zużyciem tokenów przypisuje się konstrukcji powiązanej z rozumowaniem, która zachowuje kontekst podczas zadań powtarzalnych. Adapter dostawcy (provider adapter harness) kompresuje i ponownie wykorzystuje informacje z wcześniejszych kroków wnioskowania, co pozwala AI zdawać egzamin w sposób naśladujący podejście najlepszego ucznia.

Lee Seung-hyun, profesor nadzwyczajny na Uniwersytecie Hanyang, stwierdził, że kluczem nie jest to, że model po prostu stał się inteligentniejszy, lecz że potrafi zachować wcześniejsze kroki rozumowania, skompresować kontekst i zrewidować swój plan. „Oznacza to, że zamiast za każdym razem myśleć intensywniej, kontynuował to, co wcześniej już ustalił”, powiedział Lee.

OpenAI określiło wynik jako zachęcający, zauważając, że model osiągnął wydajne przetwarzanie dzięki infrastrukturze obliczeniowej AI w skali hipernatężonej. Przedstawiciel OpenAI powiedział, że ten kamień milowy dowodzi, że modele mogą stawać się potężniejsze przy jednoczesnej poprawie wydajności i obniżaniu kosztów.

Eksperci branżowi przestrzegają jednak, że potencjał modelu należy oceniać według zdolności rozwiązywania problemów otwartych, a nie wyłącznie według wyników standaryzowanych egzaminów. Osoba z koreańskiego środowiska AI stwierdziła, że większe znaczenie będzie miało, gdy AI podejmie rzeczywiste wyzwania zawodowe, w których nie ma z góry określonych odpowiedzi. To, jak czołowe modele wypadną w szerszych, niezależnych testach porównawczych — oraz czy konkurenci zmniejszą lukę pod względem efektywności — pokaże, czy wynik ten oznacza trwałą zmianę w relacji kosztów do wydajności.

Artykuł powstał na podstawie reportażu Hankook Ilbo, pisma siostrzanego The Korea Times, przetłumaczonego przez generatywny system AI i zredagowanego przez The Korea Times. Źródło: The Korea Times.