Anthropic Claude Opus 5以30.2%的得分登顶ARC-AGI-3基准测试
要点速览
- •Claude Opus 5在ARC-AGI-3上得分为30.2%,相比之下,此前纪录为OpenAI的GPT-5.6 Sol(Max)创下的7.8%。
- •ARC Prize表示,Opus 5解决了五个此前未被解决的环境,其中四个达到或超过人类水平表现。
- •ARC-AGI-3评估模型在没有外部软件辅助的情况下,独立推断规则、规划行动并解决陌生交互式环境的能力。
- •Opus 5还追平了ARC-AGI-2和ARC-AGI-1此前的最高分,分别达到90.4%和97.5%,但成本略高。
- •在私有Witness基准测试中,Opus 5得分为43.4,提升幅度较窄,并在统计意义上与Kimi K3和Fable 5持平。

Anthropic的Claude Opus 5已成为ARC-AGI-3上表现最佳的模型。ARC-AGI-3是一项基准测试,旨在检验AI系统能否解决陌生任务,而不是依赖存储的知识或训练期间见过的模式。
据ARC Prize称,Claude Opus 5在ARC-AGI-3上得分为30.2%,几乎是此前由OpenAI的GPT-5.6 Sol(Max)创下的7.8%纪录的四倍。根据ARC Prize的数据,这一结果也使Opus 5领先于Anthropic的“Fable-class”模型,后者得分约为20%。
Opus 5解决了五个此前未被解决的环境,其中四个达到或超过人类水平。25个公开演示环境中已有六个被解决。ARC Prize已公开发布完整结果、评分卡和基准测试代码。
ARC Prize的分析将Opus 5的领先归因于更强的逻辑推理能力,“which enables more autonomous exploration, planning, and execution across unfamiliar environments.” 在测试期间,研究人员还观察到他们称此前从未在AI模型中出现过的行为,包括将任务转换为代数符号,并独立构建反射方程。
在较早版本的基准测试中,Opus 5在ARC-AGI-2上达到90.4%,在ARC-AGI-1上达到97.5%。ARC Prize表示,这两项成绩均追平此前最高结果,但成本略高。
ARC-AGI-3聚焦陌生的交互式任务
ARC-AGI-3衡量AI模型处理训练期间未遇到的新任务的能力,其中包括人类通常可以较轻松解决的任务。当前版本的结构类似游戏:模型必须推断交互式环境的规则,规划行动,并逐步执行这些行动。
该基准旨在测试通用推理能力,而不是记忆化知识。ARC Prize区分了模型的独立表现和使用额外软件的系统,这类额外软件被称为harness。一些AI系统可能已经借助这种外部辅助通过了该基准,但官方分数只计算语言模型自身的表现。ARC Prize认为,未来的AGI系统不应需要外部帮助来解决新任务。文章指出,如果在Claude Code中使用Opus 5,其得分可能会更高。
这一区分对于比较基准测试声明很重要,因为一个受辅助的系统可以将语言模型与工具、脚手架或其他执行支持结合起来,而ARC-AGI-3的官方排名旨在隔离模型自身探索并解决新环境的能力。
独立测试显示提升幅度更为有限
Anthropic尚未解释这一改进。原文称,有针对性的数据标注和强化学习是可能的因素,同时指出Opus 5是在ARC-AGI-3及其格式公开之后开发的。这一时间点可能使Anthropic能够聚焦该基准所需的技能和谜题格式,但这并不表明该公司使用了确切任务进行训练。
标注人员可能对类似谜题中的推理轨迹、有用行动、失败尝试和恢复步骤进行了标注。随后,强化学习可以奖励探索、规划、规则发现和自我纠正。
在Guanghan Ning用于交互式谜题游戏的私有基准Witness上的测试表明,提升更为有限。Opus 5得分为43.4,在统计意义上与Kimi K3和Fable 5持平;相较Opus 4.8的提升幅度远小于其在ARC-AGI-3上的提升。在这些测试中,Opus 5在采取任何行动之前识别出了一个传统谜题的隐藏规则,但在一个机制不太熟悉的游戏中落后于Opus 4.8。
Ning表示,这种模式与基于特定类型数据进行训练相一致,不过Witness无法识别Anthropic使用了哪些数据。他的评论发布在X上:https://x.com/quietnning/status/2080786711861407883。
ARC-AGI-3背后的研究人员之一Greg Kamradt表示,这些结果并不能排除更广泛推理能力提升的可能性。基于熟悉机制构建的游戏并不能测试对新颖性的适应能力,而在缺少该任务详细分数的情况下,一个较弱结果也不足以抵消模型整体改进。Kamradt的评论发布在X上:https://x.com/GregKamradt/status/2081031602596200614。
Witness本身也是围绕ARC-AGI-3风格谜题设计的,因此更强表现可能反映真正的迁移能力,而非记忆。Ning后来澄清说,Opus 5确实能够泛化到Witness,但程度远低于其在ARC-AGI-3上的表现。他将这一过程与编程基准测试的演变相比较,称作为交互式推理的一个主要目标,ARC-AGI-3很可能首先吸引最多训练投入。
Ning表示,覆盖更多边缘案例随后可能帮助模型泛化到更广泛的抽象推理任务。他将这一模式比作编程领域的发展:从HumanEval等已趋于饱和的基准,转向频繁更新的竞赛以及今天的编程智能体。他后来的澄清发布在:https://x.com/quietnning/status/2081073990614061084。