Anthropic Claude Opus 5 以 30.2% 成績登上 ARC-AGI-3 基準測試榜首
重點速覽
- •Claude Opus 5 在 ARC-AGI-3 上得分 30.2%,高於 OpenAI 的 GPT-5.6 Sol (Max) 先前創下的 7.8% 紀錄。
- •ARC Prize 表示,Opus 5 解決了五個此前尚未被解開的環境,其中四個達到或超過人類水準。
- •ARC-AGI-3 評估模型在沒有外部軟體輔助下,獨立推斷規則、規劃行動並解決陌生互動環境的能力。
- •Opus 5 也追平了 ARC-AGI-2 和 ARC-AGI-1 的先前最高分,分別達到 90.4% 和 97.5%,但成本略高。
- •在私有 Witness 基準測試上,Opus 5 得分 43.4,顯示增益較窄,並與 Kimi K3 和 Fable 5 在統計上持平。

Anthropic 的 Claude Opus 5 已成為 ARC-AGI-3 上表現最佳的模型。ARC-AGI-3 是一項基準測試,旨在檢驗 AI 系統是否能解決陌生任務,而不是依賴儲存的知識或訓練期間見過的模式。
根據 ARC Prize,Claude Opus 5 在 ARC-AGI-3 上得分 30.2%,幾乎是 OpenAI 的 GPT-5.6 Sol (Max) 先前創下 7.8% 紀錄的四倍。根據 ARC Prize,這一結果也讓 Opus 5 超越 Anthropic 的「Fable-class」模型,後者約達到 20%。
Opus 5 解決了五個此前尚未被解開的環境,其中四個達到或超過人類水準。25 個公開示範環境中,目前已有六個被解決。ARC Prize 已公開提供完整結果、評分卡和基準測試程式碼。
ARC Prize 的分析將 Opus 5 的領先歸因於更強的邏輯推理能力,「which enables more autonomous exploration, planning, and execution across unfamiliar environments.」在測試期間,研究人員還觀察到他們稱此前未曾在 AI 模型中出現過的行為,包括將任務轉換為代數符號,以及獨立建立反射方程式。
在較舊版本的基準測試中,Opus 5 在 ARC-AGI-2 上達到 90.4%,在 ARC-AGI-1 上達到 97.5%。ARC Prize 表示,這兩項成績都與先前的最高結果相當,不過成本略高。
ARC-AGI-3 聚焦於陌生的互動任務
ARC-AGI-3 衡量 AI 模型處理訓練期間未曾遇到的新任務的能力,包括人類通常能輕易解決的任務。目前版本的結構類似遊戲:模型必須推斷互動環境的規則、規劃行動,並逐步執行這些行動。
這項基準測試旨在測試一般推理能力,而非記憶化的知識。ARC Prize 區分模型的獨立表現,以及使用額外軟體(稱為 harness)的系統。有些 AI 系統可能已在這類外部輔助下通過該基準測試,但官方分數只計入語言模型本身的表現。ARC Prize 主張,未來的 AGI 系統不應需要外部協助才能解決新任務。文章指出,如果在 Claude Code 中使用 Opus 5,其得分可能會更高。
這一區分對比較基準測試主張十分重要,因為受輔助的系統可以將語言模型與工具、支架式流程或其他執行支援結合,而 ARC-AGI-3 的官方排名旨在隔離模型自身探索並解決新環境的能力。
獨立測試顯示增益較為有限
Anthropic 尚未解釋這項提升。來源文章稱,針對性的資料標註和強化學習是可能因素,同時指出 Opus 5 是在 ARC-AGI-3 及其格式公開後開發的。這一時間點可能讓 Anthropic 能夠聚焦於該基準測試的技能與謎題格式,儘管這並不表示該公司使用了完全相同的任務進行訓練。
標註人員可能標記了類似謎題中的推理軌跡、有用行動、失敗嘗試和恢復步驟。隨後,強化學習可以獎勵探索、規劃、規則發現和自我修正。
在 Guanghan Ning 的互動式益智遊戲私有基準測試 Witness 上的測試顯示,增益較為有限。Opus 5 得分 43.4,與 Kimi K3 和 Fable 5 在統計上持平,而相較 Opus 4.8 的提升幅度遠小於其在 ARC-AGI-3 上的提升。在這些測試中,Opus 5 在採取任何行動之前就辨識出一個傳統謎題的隱藏規則,但在一款機制較不熟悉的遊戲中落後於 Opus 4.8。
Ning 表示,這種模式符合使用特定類型資料進行訓練的情況,不過 Witness 無法辨識 Anthropic 使用了哪些資料。他的評論發布在 X:https://x.com/quietnning/status/2080786711861407883。
ARC-AGI-3 背後的研究人員之一 Greg Kamradt 表示,這些結果並未排除更廣泛推理能力提升的可能性。建立在熟悉機制上的遊戲無法測試對新穎性的適應能力,而在沒有該任務詳細分數的情況下,一項較弱結果也不能抵消模型的整體提升。Kamradt 的評論發布在 X:https://x.com/GregKamradt/status/2081031602596200614。
Witness 也是圍繞 ARC-AGI-3 風格謎題設計的,因此更強的表現可能反映真正的遷移能力,而非記憶。Ning 後來澄清,Opus 5 確實能泛化到 Witness,但程度遠低於其在 ARC-AGI-3 上的表現。他將這一過程比作程式碼基準測試的演進,並表示作為互動推理的主要目標,ARC-AGI-3 可能會最先吸引最多訓練投入。
Ning 表示,涵蓋更多邊緣案例之後,可能有助於模型泛化到更廣泛的抽象推理任務。他將這一模式比作程式設計領域,後者從 HumanEval 等已趨於飽和的基準測試,轉向頻繁更新的競賽以及今日的程式設計代理。他後續的澄清發布於:https://x.com/quietnning/status/2081073990614061084。