Claude Opus 5 在多项基准测试中领先,同时成本低于 Fable 5
要点速览
- •Claude Opus 5 在 Artificial Analysis 智能指数上得分 61,略微领先 Claude Fable 5、GPT-5.6 Sol、Kimi K3 和 Claude Opus 4.8。
- •在编码测试中,Opus 5 在 Artificial Analysis 编码指数上并列第一,并在 Terminal-Bench v2.1 的 max 等级下以 89% 的得分追平 GPT-5.6 Sol。
- •事实准确性仍是较弱领域,Opus 5 在 AA-Omniscience 上落后于 Fable 5,幻觉率上升 14 个百分点至 50%。
- •Epoch AI 对 Opus 5 的总体评分略低于 Fable 5,而 GPT-5.6 Sol 在 Epoch 能力指数总排名和软件工程类别中均居首位。
- •Vals.ai 发现 Opus 5 的 high 推理等级在 Vibe Code Bench 上表现最佳,超越了成本更高的 xhigh 和 max 等级。

根据多项基准测试结果,Anthropic 的 Claude Opus 5 是目前最强大的 AI 模型,在分析质量、编码和知识工作任务方面表现尤为突出。该模型在许多测试中追平或超越 Claude Fable 5,同时成本普遍更低,但评估也显示,当模型在不确定情况下仍选择作答时,幻觉率较高。
在 Artificial Analysis 智能指数上,Claude Opus 5 得分为 61。该指数综合了涵盖知识工作、编码、科学推理和事实准确性的九项测试。这一结果使 Opus 5 略微领先于得分为 60 的 Claude Fable 5、59 分的 GPT-5.6 Sol、57 分的 Kimi K3 以及 56 分的 Claude Opus 4.8。Artificial Analysis 在该模型公开发布前与 Anthropic 合作进行了测试。
在编码基准测试中,Claude Opus 5 在"xhigh"推理等级下配合 Claude Code 使用,在 Artificial Analysis 编码指数上并列第一。该指数衡量 AI 模型独立完成编程任务的能力,包括识别和修复漏洞。在 Terminal-Bench v2.1 上——该测试评估代理在真实终端环境中作为自主工程师的表现——Opus 5 在"max"等级下得分 89%,追平了此前的领先者 GPT-5.6 Sol。
在科学推理方面,Opus 5 在 Humanity's Last Exam 上得分 53%,这是一项涵盖多个学术领域的难度极高的知识测试,成绩与 Claude Fable 5 持平。在 CritPt 上——一项由 Argonne 国家实验室和 UIUC 研究人员开发的物理基准测试——Opus 5 再次追平 Fable 5,但落后于 GPT-5.6 Sol、GPT-5.5 Pro 和 GPT-5.6 Terra。
事实准确性仍然是一个较弱的领域。在测试模型知识声明准确性的 AA-Omniscience 上,Opus 5 较 Opus 4.8 提高了 7 分,但仍落后于 Fable 5。该模型在不确定时也更频繁地作答,导致幻觉率上升 14 个百分点至 50%。这一权衡对于用户希望模型完成长而复杂的任务、但在答案缺乏支持时仍需要可靠的拒答或不确定性处理的部署场景至关重要。
Epoch AI 结果显示前沿模型竞争激烈
Epoch AI 也对 Claude Opus 5 进行了评估。该研究机构给予该模型 159 的 Epoch 能力指数总分,略低于 Fable 5 的 161 分。在软件工程子集(即 SWE-ECI)中,Opus 5 以 161 分追平 Fable 5,并超越了 GPT-5.6 Terra 和 Claude Opus 4.8。GPT-5.6 Sol 在总指数和软件工程类别中均居首位。
这些结果表明前沿模型之间的性能差距非常小。没有单一模型在所有类别中显示出明显的领先优势。这一发现与 AI 模型可能日趋商品化的观点一致,该观点也曾在与微软 CEO 萨提亚·纳德拉相关言论的讨论中被提及。这也解释了为什么买家和开发者越来越多地根据工作负载、延迟、可靠性和成本来比较模型,而非仅仅依赖单一的头条分数。
较低推理等级在编码中可提供更高性价比
使用 Opus 5 时,智能指数的平均每任务成本为 2.03 美元。这低于带回退机制的 Claude Fable 5 的 2.75 美元,但高于 Opus 4.8 的 1.80 美元和 Sonnet 5 的 1.53 美元。然而,在"high"和"xhigh"推理等级下,Opus 5 以更低的成本超越了 Opus 4.8 和 Sonnet 5。
Vals.ai 使用编程任务基准测试 Vibe Code Bench 对 Claude Opus 5 的全部五个推理等级进行了测试。得分从"low"的 76.7% 上升至"medium"的 82% 和"high"的 89.8%。在两个最高等级上性能出现下降:"xhigh"得分 88.3%,"max"得分 88.4%,尽管成本大幅提高。
Vals.ai 发现,最高等级往往生成更复杂的解决方案,但这些方案更频繁地出现错误。"high"等级生成的方案更简单,但更可靠地满足要求。
Terminal-Bench 2.1 呈现了类似的规律。"high"等级优于"max"等级,因为模型在最高等级的每次尝试上花费更多时间,导致在基准测试的时间限制内完成的尝试次数更少。这与 Anthropic 的指导建议一致,即在该 API 和 Claude Code 中将"high"设为默认等级。
Token 定价保持为每百万输入 token 5 美元、每百万输出 token 25 美元。缓存写入成本为每百万 token 6.25 美元,有效期为五分钟,而缓存命中成本仅为每百万 token 0.50 美元。这些定价使得输出长度、重试行为和提示缓存成为代理编码和文档密集型工作流有效成本的重要组成部分。
Opus 5 在知识工作评估中领先
Opus 5 在 AA-Briefcase 基准测试上表现尤为出色,该基准衡量 AI 模型处理常见办公任务的能力,例如基于数千个输入文件撰写研究报告、制作演示文稿和分析电子表格。该基准从正确性、分析质量和展示质量三个维度评分,然后将结果转换为类似国际象棋排名的 Elo 评分。
在 max 推理等级下,Opus 5 达到 1720 的 Elo 分数,领先 Claude Fable 5(1574 分)146 分。其三个最高等级——max、xhigh 和 high——占据了前三名。加上 Fable 5、Sonnet 5 和 Opus 4.8,Anthropic 模型现在占据了前 10 名中的绝大多数席位。
每任务成本下降了 20%,降至 17.79 美元,而 Fable 5 为 22.30 美元。"xhigh"版本每任务成本为 14.26 美元,"high"为 10.41 美元,不到 Fable 5 的一半。两个等级在 Elo 排名上仍领先于 Fable 5。在 medium 性能等级下,Opus 5 获得 1470 的 Elo 分数,仅略低于 max 等级的 GPT-5.6 Sol(1505 分)。在 low 性能等级下,Opus 5 得分 1223 Elo,略低于 max 等级的 GLM-5.2(1254 分)。
Opus 5 最大的提升体现在分析质量方面。在"max"等级下,该模型达到 2016 的分析质量 Elo 分数,领先 Fable 5 近 300 分。其评分标准通过率(Rubric Pass Rate,即衡量模型满足预定义质量标准的频率)在"max"等级为 58%,"xhigh"为 57.2%,"high"为 56%。
展示质量方面则没那么突出。Opus 5 的展示 Elo 分数为 1628,比"max"等级的 GPT-5.6 Sol(1666 分)低约 40 分。
更高的性能也需要更多时间。在"max"等级下,Opus 5 每个任务耗时超过 36 分钟,平均通过 103 次,比 Opus 4.8(耗时 24 分钟、平均通过 55 次)长约 50%。对于评估该模型的团队而言,基准测试结果表明,最佳等级的选择取决于任务是更需要最大限度的分析、更快的交付速度,还是更低的单任务成本。