ニュースマクロOpenAIのGPT-6 Astra、記録的な低トークン数で韓国CSAT初の満点を達成

OpenAIのGPT-6 Astra、記録的な低トークン数で韓国CSAT初の満点を達成

著者: The Korea Times Business·

重要ポイント

  • OpenAIのGPT-6 Astraは「2026 CSAT LLM Solution Log」で450点満点を獲得し、全科目で満点を達成した初のモデルとなった。
  • Astraのトークン使用量は357,000で、公開モデルの中で最も少ない報告値であり、競合に比べて推論コストを抑えられる。
  • OpenAIのGPT-5.6は448.5点で2位となり、GPT-5.4の448点、Claude Fable 5.1の447.5点、Gemini 3.1 Proの445点が続いた。
  • 効率性は、反復タスク中に過去の推論ステップのコンテキストを保持・圧縮・再利用する設計によるものとされる。
  • 業界専門家は、AIの能力は標準化試験の結果だけでなく、開放的な実世界の問題解決能力で判断すべきだと注意を促している。
OpenAIのGPT-6 Astra、記録的な低トークン数で韓国CSAT初の満点を達成

新たに公開された分析によると、OpenAIの最新人工知能モデルが、韓国の大学修学能力試験(CSAT)で初めて満点を獲得した。トップクラスのAIモデルはこれまでも満点に近い結果を出してきたが、今回の成果が特に注目されているのは、競合モデルより少ないトークンで達成した点にある。トークン使用量は、これらのモデルを大規模に運用する開発者や企業にとって推論コストに直接つながる指標であり、商業的な意味を持つ。

日曜日にGitHubで公開された結果によると、OpenAIの新型GPT-6 Astraは、「2026 CSAT LLM Solution Log」で満点の450点を獲得した唯一の評価対象モデルだった。この評価では、2026年CSATの問題(韓国語、英語、数学、韓国史、および物理I、化学I、生命科学I、社会文化の4つの選択科目)を、インターネット接続なしでテストした。毎年数十万人の韓国の受験生が受ける標準化試験であるCSATは、フロンティアモデルが試験条件下で多言語・多科目の推論をどれだけ処理できるかを比較する繰り返し使われる物差しとなっている。

Astraは、この評価で全科目にわたり満点を達成した初めてのAIモデルとなった。2月にはGoogleのGemini 3.1 Proが化学Iと生命科学Iの2つの選択科目のみで満点を獲得したが、今回のより広い形式では物理Iと社会系科目の問題を落としていた。

日曜日に発表されたランキングでは、OpenAIのGPT-5.6が448.5点で2位、GPT-5.4が448点で3位となった。AnthropicのClaude Fable 5.1が447.5点で4位、Gemini 3.1 Proが445点で5位だった。

GPT-6 Astraのトークン使用量は357,000で、公開されているモデルの中で最も少ない報告値となった。比較すると、GPT-5.6は429,000トークン、Claude Fable 5.1は562,000トークンを使用した。試験の問題と解答は公開されていたため、訓練データを通じた事前曝露の可能性は排除できないが、Claude Fable 5.1やGemini 3.1 Proなどの競合モデルも同じ条件だった。

同モデルの高い性能と少ないトークン使用量は、反復的なタスク中にコンテキストを保持する推論連動型設計によるものとされる。プロバイダアダプタハーネスが過去の推論ステップの情報を圧縮・再利用することで、AIが高得点の受験生のアプローチを模倣しながら試験に取り組めるようになっている。

漢陽大学の兼任教授であるLee Seung-hyun氏は、重要なのはモデルが賢くなったことだけではなく、過去の推論ステップを保持し、コンテキストを圧縮し、計画を修正できることだと述べた。「毎回より深く考えるのではなく、以前に解明した内容を引き続き活用したということです」とLee氏は語った。

OpenAIはこの結果を心強いものだと評価し、ハイパースケールAIコンピューティングインフラを活用して効率的な処理を実現したと説明した。OpenAIの関係者は、この節目となる成果は、性能を向上させコストを下げながらモデルをより強力にできることを示していると述べた。

一方、業界の専門家は、モデルの潜在能力は標準化試験の点数だけでなく、開放的な問題を解決する能力で判断すべきだと注意を促した。韓国のAI業界関係者は、決まった正解のない実社会の職場での課題にAIが取り組めれば、より意義深いだろうと述べた。主要モデルがより広範な独立系ベンチマークでどのような成績を残すか、そして競合が効率性の格差を縮められるかどうかによって、この結果がコストと性能のトレードオフにおける持続的な変化を示すものかどうかが明らかになるだろう。

本記事は、The Korea Timesの姉妹紙であるHankook Ilboの報道に基づき、生成AIシステムによって翻訳され、The Korea Timesが編集したものです。元ソース:The Korea Times