新闻宏观经济Anthropic 的 Claude Opus 5 在多数基准测试中超越 Fable 5,价格仅为其一半

Anthropic 的 Claude Opus 5 在多数基准测试中超越 Fable 5,价格仅为其一半

作者: Decrypt·

要点速览

  • Claude Opus 5 于7月24日发布,定价为每百万输入 token 5美元,恰好是 Fable 5 价格的一半,同时在几乎所有主要基准测试中表现更优。
  • Opus 5 现已成为 Claude Max 的默认模型和 Claude Pro 的最强选项,在 Fable 5 因出口管制问题和仅限积分限制后,有效取代其成为 Anthropic 的订阅旗舰。
  • 在 Frontier-Bench v0.1 上,Opus 5 取得43.3%的成绩,在端到端软件工程任务中超越了 Fable 5 的33.7%和 OpenAI GPT-5.6 Sol 的34.4%。
  • Lovable 报告称,在智能体编程任务上比 Opus 4.7 提升了22%,而 Zapier 在完整的流失预防工作流上为 Opus 5 记录了 AutomationBench 满分。
  • 此次发布紧随北京的 Moonshot AI 推出 Kimi K3 一周之后,该模型拥有2.8万亿参数,独立基准测试将其排在 Fable 5 和 GPT-5.6 Sol 之后,位列总体第三。
Anthropic 的 Claude Opus 5 在多数基准测试中超越 Fable 5,价格仅为其一半

Anthropic 于7月24日发布 Claude Opus 5,定价为每百万输入 token 5美元——与其前代 Opus 4.8 相同,恰好是 Fable 5 价格的一半——同时在多数主要基准测试中表现优于 Fable 5。该模型现已成为 Claude Max 的默认模型和 Claude Pro 的最强选项,有效取代 Fable 5 成为大多数订阅用户的首选。

对企业而言,Opus 5 的运行成本低于 Anthropic 的旗舰模型 Claude Fable 5。Fable 5 此前被公司定位为面向付费用户的日常前沿产品。Opus 5 在多项重要基准测试中也超越了 Fable 5。对于在 AI API 上构建产品的企业来说,token 成本随用户量直接增长,一款以半价实现匹配甚至超越前沿性能的模型,能够显著改变单位经济模型。

Anthropic 的模型分层结构

Anthropic 的产品线涵盖四个层级。Haiku 快速且廉价。Sonnet 为中端定位。Opus 是重型主力模型。在此之上是 Mythos 级别——这是 Anthropic 今年春季推出的一个层级,包括面向公众的 Claude Fable 5,以及 Claude Mythos 5——一个限制更少的版本,通过 Project Glasswing 面向经过审核的网络安全研究人员和关键基础设施运营者提供。

Fable 5 作为订阅旗舰经历了一段波折。它于6月9日上线,仅三天后因美国政府以越狱漏洞为由发布紧急出口管制令而在全球下架。6月30日重新上线后,立即转为仅限积分模式,不再包含在标准套餐中。Opus 5 如今填补了 Fable 5 未能守住的位置。

Lovable 是一个拥有数百万用户的开发者平台,该平台在内部评估中测试了 Opus 5,并指出提升不仅体现在原始分数上。"它不仅在我们最难的智能体编程任务上表现更佳——比 Opus 4.7 提升了22%——而且更加稳定,每次运行之间的差异大幅减小," Fabian Hedin 在 Anthropic 分享的一份声明中表示。

基准测试结果

尽管未像 Fable 那样被标记为 Mythos 级别,Opus 5 在几乎所有与日常用户相关的指标上都超越了 Fable 5。

在 Frontier-Bench v0.1——一项测试 AI 编程智能体是否能端到端完成真实软件工程任务的基准测试,以通过任务百分比评分——Opus 5 达到了43.3%。Fable 5 为33.7%,而 Anthropic 的主要商业竞争对手 OpenAI 的 GPT-5.6 Sol 为34.4%。

最大差距出现在 ARC-AGI-3 上——一项以模型无法从训练数据中记忆的新颖谜题为核心的真正问题解决能力测试,以解出谜题百分比评分。Opus 5 达到30.2%;GPT-5.6 Sol 为7.8%;Fable 5 则完全未参与测试。

在 GDPval-AA v2——一项通过 Elo 评级评分的知识工作基准测试,Elo 是类似国际象棋排名的系统,用于衡量在真实专业任务中的相对表现——Opus 5 达到1,861分,而 Fable 5 为1,747分,GPT-5.6 Sol 为1,736分。

Zapier 在 AutomationBench 上测试了 Opus 5——一项评估模型能否在无人干预的情况下从头到尾完成完整业务流程的测试。他们的结论是:该模型"拿过一份原始的账户健康状况工作簿,端到端运行了完整的流失预防流程:标记高风险账户、通知相关负责人、并为留存运营团队生成摘要。之前的模型未能通过;Opus 5 达到了100%。"

Anthropic 还将 Opus 5 定位为研究能力的升级。DNA 测序公司 Ultima Genomics 表示,该模型"表现得更像一位严谨的科学家,超过我们运行过的任何模型。它会主动选择正确的统计检验来排除混淆因素,通过独立方法交叉验证自己的结果,并在漫长的多步骤分析中保持专注。"

不过,法律和健康是 Fable 5 仅有的两个以微弱优势领先的领域。

更广泛的竞争格局

此次发布发生在北京初创公司 Moonshot AI(获阿里巴巴支持)推出 Kimi K3 一周之后——这是一个拥有2.8万亿参数的开源权重模型,意味着任何人都可以下载底层代码独立运行。Moonshot 将其描述为全球最大的开放 AI 系统。独立基准测试一致将 Kimi K3 排在总体第三位,落后于 Fable 5 和 GPT-5.6 Sol,但在特定领域超越这两者。这种开源权重方式与 Anthropic 和 OpenAI 采用的仅限 API 访问模式形成对比,使组织能够在自己的硬件上运行模型——不过,一个2.8万亿参数的系统需要大量计算资源来运行。

定价与可用性

Opus 5 现已通过 API 提供,价格为每百万输入 token 5美元、每百万输出 token 25美元。(Token 是 AI 模型在输入和输出中处理的基本信息单位。)此外还提供快速模式,运行速度约为默认速度的2.5倍,价格为基础价格的两倍——每百万输入 token 10美元、每百万输出 token 50美元。

此次发布可能有助于缓解关于 Fable 5 公开可用性有限的持续担忧。Opus 5 也面向所有用户通过订阅方式提供。