Anthropic 发布 Claude Opus 5:支持 1M Token 上下文,Opus 定价不变
要点速览
- •Claude Opus 5 取代 Claude Opus 4.8,API 价格保持不变:每百万输入 token 5 美元、每百万输出 token 25 美元。
- •开发者可能需要更新应用,因为 thinking 现在默认启用,且 max_tokens 同时涵盖推理 token 和输出文本。
- •Opus 5 在多项编码和智能体基准测试中的表现强于 Opus 4.8,包括 FrontierBench、OSWorld 2.0 和 Zapier AutomationBench。
- •Anthropic 表示 Opus 5 的网络安全能力有所提升,但仍采用与 Opus 4.8 相同的 ASL-3 保护措施。
- •与 Opus 4.8 相比,Opus 5 在 Gray Swan 和 Claude Cowork 浏览器环境测试中的提示注入攻击成功率下降。

Anthropic 今日发布 Claude Opus 5,取代 Claude Opus 4.8,成为其 Opus 层级的旗舰模型。定价保持不变:每百万输入 token 5 美元、每百万输出 token 25 美元,使这款新旗舰模型维持与被替代模型相同的 API 费率。
Anthropic 称,Opus 5 的智能水平接近 Claude Fable 5,而价格仅为其一半。该模型现已成为 Claude Max 的默认模型,并是 Claude Pro 上可用的最强模型。
API 层面的变化
Anthropic 在 Opus 5 中引入了多项 API 层面的变化,开发者在评估基准测试结果或将现有应用迁移到新模型之前,可能需要加以考虑。
首先,thinking 默认启用。在 Opus 4.8 中,除非开发者设置 thinking: {"type": "adaptive"},否则请求不会运行 thinking。到了 Opus 5,同样的请求会默认进行 thinking,而 effort 参数控制其深度。由于 max_tokens 现在同时限制 thinking token 和响应文本,现有的 token 限制可能需要重新审查。
其次,Anthropic 引入了一项破坏性变更。将 thinking: {"type": "disabled"} 与设置为 xhigh 或 max 的 effort 一起使用的请求,现在会返回 400 错误。该限制按每个请求执行。开发者必须将 effort 限制在 high,或移除 thinking 字段。
第三,Anthropic 建议开发者移除验证提示。诸如“include a final verification step”这样的指令现在可能导致过度验证,因为模型已经会验证自身工作。Anthropic 的 Opus 5 提示指南涵盖了相关调优模式。
模型 ID 为 claude-opus-5。其上下文窗口默认为 1M token,最大值同样为 1M token,且没有更小的变体。同步 Messages API 的最大输出为 128k token。Message Batches API 在使用 output-300k-2026-03-24 beta header 时支持最高 300k 输出 token。可缓存提示的最小长度已从 1,024 token 降至 512 token。
编码和智能体基准测试结果
在 FrontierBench v0.1 上,Opus 5 在 max effort 下得分 43.3%。FrontierBench v0.1 是 Terminal-Bench 2.1 的后续基准,包含 74 项任务。Opus 4.8 得分 18.7%,Fable 5 达到 33.7%,GPT-5.6 Sol 达到 37.5%。在 xhigh effort 下,Opus 5 取得其最佳结果,平均奖励达到 44.4%。
该次运行中一个值得注意的细节与安全拒绝有关。Opus 5 的安全分类器在 4% 的试验中标记并拒绝了 5% 的 API 调用。Fable 5 的分类器则在 26% 的试验中标记了 42% 的调用。
Opus 5 在 SWE-bench Verified 上得分 96.0%,在 SWE-bench Pro 上得分 79.2%。Fable 5 在 SWE-bench Pro 上仍略微领先,得分为 80.0%。在 SWE-bench Multimodal 上,Opus 5 从 38.4% 提升至 59.4%。
最明显的提升出现在智能体评估中,在这些评估里,模型必须在软件环境中操作,而不是回答单一的静态提示。Opus 5 在 OSWorld 2.0 上达到 70.57%,相比之下 Opus 4.8 为 55.7%。在 Zapier AutomationBench 上,它得分 26.0%,而 Opus 4.8 为 17.0%,Fable 5 为 17.4%。在 medium effort 下,Opus 5 仍以每项任务 0.89 美元的成本获得 24% 的得分。
在 Artificial Analysis GDPval-AA v2 上,Opus 5 以 ELO 1861 和 1827 占据排行榜前两位。xhigh 配置在使用比 max 少 25% 输出 token 的情况下,表现优于所有其他模型。
推理结果与 ARC-AGI-3
Anthropic 在不使用工具或智能体框架的情况下,让 Opus 5 处理全部六道 IMO 2026 题目。由三个模型组成的评审小组判定全部 24 个生成解答均正确。人类专家还分别对每道题一个预先指定的解答进行独立评分,均为 7/7。最终得分 42/42 达到金牌水平,高于 29/42 的分数线。
ARC Prize Foundation 报告称,Opus 5 在 high effort 下的 ARC-AGI-3 验证得分为 30.16%。这大约是此前报告的排行榜最佳成绩的四倍。GPT-5.6 Sol 达到 7.78%,Opus 4.8 达到 1.52%。发布时尚无 Opus 5 在 max effort 下的结果。
在 Humanity’s Last Exam 上,Opus 5 不使用工具时得分 56.3%,使用工具时得分 64.7%。
多模态任务中的工具使用
Anthropic 的多模态结果表明,与仅依靠 adaptive thinking 相比,智能体式工具使用能以更具成本效益的方式扩展测试时计算。
在 Chartography 上,Opus 5 不使用工具时得分 29.6%,在使用容器和图像裁剪工具时得分 83.0%。在 BenchCAD Vision2Code 上,voxel IoU 从 0.366 升至 0.821。借助工具,Opus 5 超过了 Claude Mythos 5,后者在同一指标上的得分为 0.678。
网络安全能力与防护措施
Anthropic 表示,并未针对网络安全任务训练 Opus 5。尽管如此,作为整体能力提升的副产品,该模型的网络安全能力仍有所增强。
在 ExploitBench 上,Opus 5 在 AutoNudge 分支中捕获了平均 10.14 个能力标志,并生成了 99 个完整的任意代码执行漏洞利用。Mythos 5 生成了 132 个。在 OSS-Fuzz 上,Opus 5 在 79.4% 的目标上取得非零得分,而 Mythos 5 约为 80%。不过,Opus 5 完成了 4 个完整漏洞利用,而 Mythos 5 为 13 个。
这一差距影响了 Anthropic 的安全防护设计。Opus 5 在发现漏洞方面几乎与 Mythos 5 一样强,但在利用漏洞方面明显更弱。因此,Anthropic 解除了对源代码漏洞发现的限制。基于二进制的扫描、渗透测试和漏洞利用生成仍然被阻止。Anthropic 预计,分类器介入频率将比 Fable 5 低约 85%。防御方可以申请加入 Cyber Verification Program。
UK AISI 在三个网络靶场上测试了早期检查点,每次尝试使用 100M token。Opus 5 在 10 次尝试中有 8 次端到端解决了“The Last Ones”。它未能解决难度更高的“Doing Life”靶场,但达到了 23 个步骤中的第 22 步,超过了所有已测试模型。
根据 Anthropic 的 Responsible Scaling Policy,该公司将 Opus 5 视为具备 CB-1 能力,但不具备 CB-2 能力。Anthropic 正在应用与 Opus 4.8 相同的 ASL-3 保护措施。AI R&D 阈值并未被跨越。
提示注入结果
在 Gray Swan 间接提示注入基准测试中,攻击者在 15 次尝试内的成功率从 Opus 4.8 的 5.5% 降至 Opus 5 的 2.0%。Mythos 5 为 2.6%,而 GPT-5.6 Sol 为 20.0%。
在通过 Claude Cowork 运行的浏览器环境中,攻击成功率从 Opus 4.8 的 31.5% 降至 Opus 5 的 3.70%。该结果是在未应用任何防护措施的情况下测得的。启用自动模式后,全部 129 个环境中的攻击成功率达到 0%。
原始报道引用的来源包括 Anthropic 发布文章、Claude Opus 5 System Card、Claude Opus 5 新变化、TechCrunch 和 CodeRabbit 独立评测。