新闻宏观经济Anthropic称新版Claude Opus 5以一半的Token价格实现接近Fable 5的性能

Anthropic称新版Claude Opus 5以一半的Token价格实现接近Fable 5的性能

作者: The Decoder·

要点速览

  • Claude Opus 5延续了前代模型的Token定价,即每百万输入Token 5美元、每百万输出Token 25美元,同时成为Claude Max的默认模型和Claude Pro上最强大的选项。
  • Opus 5在多项基准测试中领先,包括Frontier-Bench v0.1智能体终端编程(43.3%)和ARC-AGI-3(30.2%),但在DeepSWE上落后于GPT-5.6 Sol,在网络安全任务上落后于Mythos 5。
  • 该模型能够通过迭代步骤进行自我纠错并编写代码构建自身工具,其独立创建计算机视觉流水线从图纸重建3D机器零件的能力即是明证。
  • Opus 5的网络安全安全分类器触发频率比Fable 5低约85%,回应了开发者对Fable 5频繁干预打断合法编程和安全研究工作的批评。
  • max effort设置在两项基准测试中的结果略逊于第二高设置,尽管成本更高,表明更高的计算投入并不能保证模型输出的改善。
Anthropic称新版Claude Opus 5以一半的Token价格实现接近Fable 5的性能

Anthropic将其新旗舰模型Claude Opus 5定位为Claude Fable 5的低成本替代方案,称该模型在多项基准测试中超越Fable 5的同时,性能已接近后者。此次发布正值各大AI实验室在能力和成本两个维度上展开激烈竞争之际,企业客户在选择用于生产工作负载的模型时,越来越关注性价比权衡。

该公司表示,Opus 5在智能体编程和知识工作测试中领先——这两个领域正是企业最密集部署AI的方向。在ARC-AGI-3这一旨在衡量新颖问题解决能力的基准测试中,Opus 5得分30.2%,几乎是GPT-5.6 Sol成绩的四倍。

Anthropic还表示,Opus 5能够通过迭代步骤检查和改进自身工作,并在需要时编写代码来构建工具——这些能力对于自主智能体工作流至关重要,因为在这些场景中模型必须以最少的人工干预完成多步骤任务。

Opus 5延续Opus 4.8定价

Anthropic推出Opus 5之际,正面临来自GPT-5.6 Sol和中国竞争对手日益增长的定价压力。新模型旨在缩小与更昂贵的Fable 5之间的性价比差距。Opus 5成为Claude Max的默认模型,也是Claude Pro上提供的最强大模型。

该模型保持了100万Token的上下文窗口以及与前代模型Opus 4.8相同的Token费率。Opus 5的定价为每百万输入Token 5美元、每百万输出Token 25美元。新增的Fast Mode可将速度提升2.5倍,但价格翻倍。

基础Token费率并不能完全反映每项任务的实际总成本,因为不同模型的Token效率存在差异。Opus 4.7每项任务的成本比Opus 4.6高出30%至40%,尽管两个模型使用相同的基础费率。类似的情况最近也出现在Claude Sonnet 5上。这一区别对于大规模部署的组织意义重大,因为在数百万次API调用中,单任务成本差异会不断累积。

更高的effort设置可能花费更多却未必改善结果

用户可以通过五个effort设置来平衡性能和Token用量:low、medium、high、xhigh和max。Anthropic表示,Opus 5在每一个effort级别上都比前代模型提供更高的性价比。

在其提示指南中,Anthropic建议广泛使用"low"和"medium"设置。该公司表示,这些设置仅需少量Token用量和延迟即可交付良好的结果,同时在相同设置下超越了早期Opus模型的表现。对于编程和智能体任务,Anthropic仍建议从"xhigh"开始。

Opus 5在max effort设置下的表现略逊于第二高设置,尽管max的成本更高,这一下降出现在Frontier-Bench v0.1和Artificial Analysis Coding Agent Index两项基准测试中。这一发现表明,更高的计算投入并不能保证更好的输出结果,这是在优化成本与质量之间权衡时需要考虑的因素。

Anthropic基准测试显示Opus 5在智能体编程中领先

根据Anthropic自身的基准测试结果,Opus 5在多项评估中创下纪录。在Frontier-Bench v0.1上,其在智能体终端编程中达到43.3%,领先于Fable 5的33.7%、GPT-5.6 Sol的34.4%以及Opus 4.8的21.1%。

在知识工作基准测试GDPval-AA v2上,Opus 5以1,861的Elo分数领先。Fable 5得分为1,747,GPT-5.6 Sol为1,736。

Opus 5并非在所有测试中均领先。在衡量智能体编程能力的DeepSWE v1.1上,GPT-5.6 Sol以72.7%排名第一,Fable 5以69.7%紧随其后,Opus 5为68.8%。在医疗任务和法律基准测试中,Fable 5和Mythos 5分别优于Opus 5。这些混合结果表明,模型领先地位因领域而异,使得模型选择对于企业买家而言高度依赖具体任务。

ARC-AGI-3的结果是Anthropic基准测试集中最大的异常值之一。ARC-AGI-3评估不依赖记忆模式的新颖问题解决能力。Opus 5得分30.2%,相比之下Opus 4.8仅为1.5%,GPT-5.6 Sol为7.8%。这使得Opus 5在所引用的结果中领先次优模型近四倍。Anthropic未列出Fable 5在此基准测试上的结果,目前尚不清楚如此大的基准测试领先优势是否会转化为实际使用中的优势。

Opus 5在网络安全任务上落后于Mythos 5。Anthropic表示,其有意未对Opus 5进行网络安全任务训练,前代模型也是如此。该模型在发现漏洞方面接近Mythos 5的水平,但在被要求利用漏洞时表现明显逊色。

Anthropic还表示,Opus 5在生成视觉输出和分析图表、图示等视觉内容方面有所改善。

Anthropic称Opus 5能够自主构建所需工具

Anthropic将Opus 5描述为在审查自身工作并通过迭代改进方面有显著提升。这种自我纠错能力正日益成为构建自主智能体的AI实验室的关注重点,因为在无需人工指导的情况下检测和修复错误的能力,决定了模型能否处理复杂、开放式的任务。

在一项Frontier-Bench任务中,Opus 5获得了一份机器零件的图纸,并被要求在FreeCAD中创建3D模型。该模型被有意设置为无法直接查看图纸。

据Anthropic称,Opus 5自行编写了计算机视觉流水线,从原始像素中提取几何信息,随后重建了完整的机器零件。该公司表示,没有其他模型在五次尝试后解决了该任务。

Opus 5还处理了一个流行开源包管理器中的真实Bug。Anthropic表示,该模型找到了根本原因并修复了社区补丁遗漏的一个边缘情况。一个竞品模型仅修复了表层症状后就将Bug标记为已解决。

Anthropic还表示,一家交易公司的一名工程师在一次会话中使用Opus 5为一家新交易所构建了市场数据源。早期模型即使获得详细计划也无法完成该任务。

网络安全过滤器触发频率低于Fable 5

Anthropic表示,Opus 5的安全设置允许源代码漏洞研究,同时阻止基于二进制的漏洞扫描、渗透测试和漏洞利用生成。其网络安全分类器的触发频率比Fable 5低约85%。Fable 5频繁的安全干预曾招致开发者的强烈批评,他们报告称在合法的编程和安全研究任务中遭遇工作流中断。

Claude.ai、Claude Code和Claude Cowork中被阻止的请求默认回退到Opus 4.8,这与Anthropic在Fable 5上采用的方案相同。

Anthropic将Opus 5称为最强大的通用科学研究模型。该公司表示,它在所有生命科学评估中均优于Opus 4.8,在有机化学和蛋白质相关任务方面提升尤为显著。在有机化学领域,Opus 5在从光谱数据推导分子结构方面提升了10.2个百分点。在蛋白质相关任务方面,提升了7.7个百分点。

Anthropic还随Opus 5一同发布了两个测试版功能。Claude Platform上的Mid-Conversation Tool Changes允许开发者在对话过程中切换可用工具,而不会使提示缓存失效。API上的Automatic Fallbacks可自动将被阻止的请求路由到其他模型。这两个功能均体现了Anthropic在解决工作流连续性和可靠性方面开发者痛点上的努力。