OpenAI GPT-6 Astra 以史上最低 Token 用量首度在南韓大學入學考試拿下滿分
重點速覽
- •OpenAI 的 GPT-6 Astra 在 2026 年 CSAT LLM Solution Log 中獲得滿分 450 分,是首個在所有受測科目全部滿分的模型。
- •Astra 僅消耗 357,000 個 Token,為公開模型中通報的最低總量,相較競爭對手可降低推論成本。
- •OpenAI 的 GPT-5.6 以 448.5 分排名第二,其次為 GPT-5.4 的 448 分、Claude Fable 5.1 的 447.5 分,以及 Gemini 3.1 Pro 的 445 分。
- •該模型的效率歸功於能在重複性任務中保留、壓縮並重複利用先前推理步驟上下文的設計。
- •業界專家提醒,AI 能力應以開放式的真實世界問題解決能力來評斷,而非僅看標準化考試成績。

根據最新公布的分析,OpenAI 最新的人工智慧模型首度在南韓大學學術能力測驗(CSAT)中獲得滿分。儘管頂級 AI 模型過去也曾繳出接近滿分的成績,此次結果特別受到關注,因為該模型在達成此成就的同時,消耗的 Token 數量少於競爭對手——這項指標在商業上相當重要,因為 Token 用量直接影響大規模部署這些模型的開發者與企業所負擔的推論成本。
週日發布於 GitHub 的結果顯示,OpenAI 新推出的 GPT-6 Astra 是唯一在 2026 年 CSAT LLM Solution Log 中獲得滿分 450 分的受測模型。該評測以 2026 年 CSAT 試題測試模型,涵蓋韓語、英語、數學、韓國史以及四個選修科目——物理 I、化學 I、生命科學 I 與社會與文化——全程不開放網路存取。CSAT 是每年有數十萬韓國學生應試的標準化考試,如今已成為比較各前沿模型在考試情境下處理多語言、多科目推理能力的常用標竿。
Astra 是該評測中首個在所有受測科目全部獲得滿分的 AI 模型。今年 2 月,Google 的 Gemini 3.1 Pro 僅選修兩科——化學 I 與生命科學 I——便獲得滿分,但在此次評測採用的更全面格式下,於物理 I 與一門社會科目中失分。
在週日公布的排名中,OpenAI 的 GPT-5.6 以 448.5 分位居第二,GPT-5.4 以 448 分名列第三。Anthropic 的 Claude Fable 5.1 以 447.5 分排名第四,Gemini 3.1 Pro 則以 445 分名列第五。
GPT-6 Astra 使用了 357,000 個 Token,為公開模型中通報的最低總量。相較之下,GPT-5.6 使用 429,000 個 Token,Claude Fable 5.1 則使用 562,000 個。由於試題與答案皆已公開,此結果無法排除訓練資料中先前接觸過這些內容的可能性,不過 Claude Fable 5.1 與 Gemini 3.1 Pro 等競爭模型也面臨相同條件。
該模型的優異表現結合較低的 Token 用量,歸功於一種能在重複性任務中保留上下文的推理連動設計。其供應商轉接器架構(provider adapter harness)會壓縮並重複利用先前推理步驟的資訊,使 AI 得以模擬高分學生的作答方式完成考試。
漢陽大學兼任教授李承賢(Lee Seung-hyun)表示,關鍵不在於模型變得更聰明,而在於它能保留先前的推理步驟、壓縮上下文並修正其計畫。他說:「這代表它不必每次都更用力思考,而是延續先前已經想通的部分。」
OpenAI 將此結果形容為令人振奮,並指出該模型運用超大規模 AI 運算基礎設施實現了高效處理。一位 OpenAI 官員表示,此里程碑證明模型可以在提升效能、降低成本的同時變得更強大。
然而,業界專家提醒,模型的潛力應以其解決開放性問題的能力來評斷,而非僅看標準化考試成績。一位韓國 AI 產業人士表示,如果 AI 能夠應對沒有既定答案的真實職場挑戰,將更具意義。領先模型在更廣泛的獨立基準測試上的表現,以及競爭對手能否縮小效率差距,將顯示此結果是否代表成本與效能取捨的持久性轉變。
本文根據《韓國時報》姊妹報《每日經濟新聞》(Hankook Ilbo)的報導改寫,原報導由生成式 AI 系統翻譯並經《韓國時報》編輯。原始來源:The Korea Times。