Anthropic发布Claude Opus 5:以半价提供近前沿智能,面向企业与编程工作负载
要点速览
- •Opus 5的定价与Opus 4.8相同,而Anthropic表示其以一半的成本提供了Fable 5几乎全部的智能。
- •Anthropic报告Opus 5在Frontier-Bench v0.1上得分43.3%,相比之下Opus 4.8为18.7%,Fable 5为33.7%。
- •公司表示Fable 5仍然更适合最长的自主项目,而Opus 5在有明确结果的有限任务上表现最强。
- •早期客户提到了更低的token使用量、更少的工具调用、更快的完成时间,以及在法律、金融、自动化和编程工作流中更强的表现。
- •Opus 5包含安全分类器、在某些产品中回退到Opus 4.8的路由、Fast模式、API可用性,以及通用访问无数据保留要求。

Anthropic于周五发布了Claude Opus 5,该公司表示该模型以一半的成本提供了其旗舰产品Claude Fable 5几乎全部的智能——这一发布凸显了AI竞争格局正从原始能力转向日常使用的经济性。
该模型已在Anthropic的所有平台上即时上线。定价为每百万输入token 5美元、每百万输出token 25美元,与前代产品Opus 4.8保持一致。Opus 5成为Claude Max的新默认模型,这是Anthropic的高级消费者订阅层,同时也是Claude Pro上最强大的模型。
这一市场定位是经过深思熟虑的。Anthropic并未宣称Opus 5是其最智能的模型——这一头衔仍属于Fable 5,而且竞争对手的系统在某些领域仍保持优势。相反,公司提出了一个更为微妙的论点,直指企业买家:最具经济意义的AI工作处于中等难度区间,在这一区间内,高效且经济地交付的近前沿智能优于以高价交付的前沿智能。
"Opus 5作为你的日常主力,你将复杂工作交给它,完成后进行审查,"Anthropic发言人在接受VentureBeat采访时表示,描述了公司的模型分层策略。"Fable 5用于你最有野心的项目——那些持续数天的自主任务,此前没有任何模型能够应对……Sonnet 5用于大规模运行的工作,速度和每次调用的成本决定了最终交付什么。Haiku 4.5用于子智能体和即时回答。"
基准测试表现:Opus 5对比Fable 5及竞争对手
从数据上看,基准测试结果令人瞩目。Anthropic表示,Opus 5在编程和知识工作评估中创下了新的行业最优纪录,包括Frontier-Bench和GDPval-AA。
在Frontier-Bench v0.1(一项智能体终端编程基准测试)中,Opus 5得分43.3%——超过Opus 4.8的18.7%的两倍,也远超Fable 5的33.7%——且每个任务的成本更低,据该公司称。在ARC-AGI 3(一项评估新颖问题解决能力的测试)中,Anthropic报告Opus 5的得分是次优模型的三倍。在OSWorld 2.0(一项计算机操作基准测试)中,公司表示Opus 5以仅略超过三分之一的成本超越了Fable 5的最佳成绩。
这些数据也伴随着一些值得注意的保留意见,这在一个惯于使用夸张词的行业中本身就很引人注目。Anthropic承认Opus 5在网络安全任务和生物研究方面仍落后于竞争模型Mythos 5。一个OpenAI系列模型在一项智能体编程基准测试中仍处于领先地位。
更具启发性的保留意见直接来自Anthropic,当被问及Opus 5在哪些方面仍不及Fable 5时。发言人的回答坦率地承认了基准测试能捕捉什么以及不能捕捉什么。
"Opus 5获胜的那些评估是有明确结果的有限任务,这正是它最强的地方。那些评估没有衡量的是持续时间,"发言人告诉VentureBeat。"可以这样理解:Opus 5是基准测试能看到的最佳工具,而Fable 5则是当任务超出基准测试范围时你所需要的。"
Fable 5相比之下"用于最长、最自主的任务,模型需要在数小时或数天内跨越许多相互关联的步骤,处理密集的原始材料并保持连贯性,"发言人表示,建议客户"在具有代表性的工作负载上同时运行两个模型,一个有限任务和一个长期任务。"这种区分——有限任务与长期自主性——可能成为2026年模型差异化的决定性轴心,因为基准测试趋于饱和,最难解决的问题涉及持续的、多天的智能体工作,而非离散的难题。
Token效率:真正的企业级战场
贯穿此次发布的主题是Anthropic显然希望买家深刻理解的一点:Opus 5不仅得分高,而且每一美元的得分也很高。该模型配备了一个可调节的"effort"设置,允许客户在智能、速度和token节省之间进行权衡,Anthropic的图表强调的是在给定成本下的表现,而不仅仅是峰值性能。
早期客户以不同寻常的具体数据回应了这一点。法律AI公司Harvey表示,Opus 5实现了与Opus 4.8最大推理模式相似的性能,"同时平均生成的token减少了26%,"其应用研究负责人Niko Grupen说。Fundamental Research Lab的Richard Pham表示,在困难的金融建模任务中,该模型平均准确率高出九个百分点,"同时使用的轮次和工具调用大约减少三分之一,时间减少60%。"
Zapier首席执行官Wade Foster表示,Opus 5在其公司的AutomationBench排行榜上名列前茅,"且没有比之前的Claude模型消耗更多token,"从头到尾运行了完整的客户流失预防工作流。"之前的模型没有通过;Opus 5达到了100%,"他说。
Cognition(Devin编程智能体背后的公司)首席执行官Scott Wu表示,在FrontierCode 1.1上,"Claude Opus 5以一半的成本接近Fable级别的性能,"在调试和根因分析方面表现尤为突出。
对效率的强调反映了商业现实。企业AI支出已不再是试验性的,推理成本——大规模实际运行这些模型的价格——已成为董事会级别的议题。Anthropic的业务高度偏向API和企业使用;根据Contrary Research2026年2月的分析,截至2025年底,Claude按使用量计算占据了约40%的企业大型语言模型市场,仅Claude Code就达到了约10亿美元的年化收入。对于一家客户按token付费的公司来说,能用更少token做更多事情的模型不是一个锦上添花的功能——它就是产品本身。
自我验证的智能体与自动化的隐性成本
在数字之外,Anthropic正在推进一个行为叙事:Opus 5会验证自己的工作并反复迭代直到成功。公司提供了几个来自测试的案例,读起来像是关于机器毅力的寓言。
在一个Frontier-Bench任务中,模型被要求根据一张图纸将一个机器零件重建为3D CAD模型,但该模型被故意给予了无法查看图纸的条件。Anthropic表示,Opus 5没有失败,而是自己编写了计算机视觉流程来从原始像素中提取几何信息——并反复做到了这一点,而没有任何竞争模型在五次尝试中解决了该任务。在另一个案例中,面对一个流行开源包管理器中的真实漏洞,模型找到了根本原因并修复了社区自己的补丁遗漏的边缘情况;而一个竞争模型仅修补了症状便宣布完成。该公司表示,一家交易公司的工程师在一个会话中使用Opus 5为新交易所构建了市场数据源,由于找不到实时数据源进行验证,该模型自行构建了测试工具来检查其解析代码。
客户在生产环境中也描述了类似的行为。Stripe的软件工程师Cristian Rivera表示,他在一个周末将模型赋予"我的开发环境的参谋角色":"它建立了自己的监控系统,驱动每台服务器,只在做判断决策时才找我参与。"
这是企业最关心的能力。一个能产生看似合理输出的模型和一个能验证其输出的模型之间的差距,就是一个演示和一个可部署系统之间的差距。当今企业AI的大部分隐性成本是人工审查——工程师检查机器的工作。一个能可靠地检查自己工作的模型压缩了这一成本,这正是客户不断提到更少的轮次、更少的通过次数和更少的时间,而不是更高的原始分数的原因。
Anthropic的安全策略:能力差距、分类器和模型回退
此次发布还突显了Anthropic日益精细化的安全方法——现在甚至包括故意不教其模型某些技能。公司表示,其自动化行为审计发现Opus 5是其迄今为止最对齐的模型,整体偏差行为得分为2.3,低于Opus 4.8、Sonnet 5或Fable 5,具有最低的欺骗行为率和最少的被诱导滥用的可能性。
在能力方面,Anthropic表示与Opus 4.8一样,它故意避免在网络安全任务上训练Opus 5。尽管如此,模型在这些任务上仍有所提升——这是通用能力提升的副作用——现在在发现软件漏洞方面几乎与Mythos 5持平。但在利用漏洞方面仍远落后:在Anthropic的OSS-Fuzz评估中,Opus 5以79.4%的比率识别了漏洞,接近Mythos 5的80%,但仅在4个挑战中成功开发了漏洞利用程序,而Mythos 5为13个。这种不对称性——在防御相关的发现方面强大,在攻击相关的利用方面较弱——似乎是刻意设计的,安全防护措施也遵循同样的逻辑。Anthropic预计Opus 5的网络安全分类器的干预频率比Fable 5减少约85%。
当分类器触发时,Claude.ai、Claude Code和Claude Cowork中的请求默认回退到Opus 4.8——这引出了一个显而易见的问题:如果一个请求对一个模型来说风险太高,为什么对另一个模型就可以接受?
"回退到的模型具有较低的能力水平,使得有害使用的风险也相应降低,"发言人表示,并补充说"当这种情况发生时,会有一条消息通知用户,并在聊天中可见。"这一逻辑是站得住脚的,但它揭示了2026年AI安全的实际运作方式:风险不仅是问题本身的属性,而是问题与回答该问题的系统能力的乘积。
在生物学方面,计算方式恰恰相反。Opus 5现在是Anthropic在科学研究方面最强大的通用模型——在公司内部化学基准测试中比Opus 4.8高出10.2个百分点——尽管发言人承认"Mythos 5仍然是长期、开放式任务(如自主药物设计项目)方面更强的模型。"
商业赌注:3800亿美元估值与大规模算力投入
此次发布正值Anthropic非凡的商业增长势头——以及非凡的责任——之际。路透社2月报道,该公司在最新一轮融资中估值约为3800亿美元。根据Contrary Research的分析,年化收入从2024年底的约10亿美元攀升至2025年底预计的90亿美元,内部目标据报在2026年达到200亿至260亿美元。
这些目标由大规模基础设施投入支撑,包括据报道的300亿美元Azure算力交易以及与Google Cloud和Nvidia的合作安排——这些支出只有在企业持续扩大使用量的情况下才能收回成本。
在这一背景下,Opus 5的定价策略就显得非常合理了。将价格保持在Opus 4.8水平,同时在关键智能体基准测试上性能大约翻倍,实际上等同于每单位能力的深度降价,旨在扩大在经济上可自动化的工作负载范围。在Opus 4.8每次成功成本下处于边缘的每个任务,在Opus 5的成本下都变得可行——而每个可行的任务都代表着持续的token收入。
监管背景也变得更加复杂。一名美国法官本周做出最终批准,对Anthropic与图书作者达成15亿美元版权和解协议予以确认,路透社报道,这结束了围绕该公司早期训练数据的诉讼篇章。6月,路透社援引Axios报道,美国政府已采取行动阻止外国获取Anthropic最先进的模型——这提醒人们,前沿AI现在已与出口政策纠缠在一起,影响着哪些客户可以购买什么。
附加功能与可用性
周五同时发布的还有:以约2.5倍默认速度运行、价格为基本价格两倍的Fast模式,API上的自动回退路由,以及对话中途更换工具不再使提示缓存失效——这一小功能可能比任何基准测试都更受智能体开发者的欢迎。
与之前的Opus模型一致,Opus 5对通用访问没有数据保留要求,发言人主动为有"严格零数据保留要求"的客户指出了这一点。开发者从今天起可以在Claude API上以claude-opus-5的名称访问该模型。
两个问题将决定这场赌注是否能获得回报:Opus 5的效率声称是否能在大规模生产工作负载的考验中存活下来,以及企业是否愿意接受一个由安全分类器(而非用户)有时决定由哪个模型回答问题的世界。
周五发布会更深层的含义是,AI行业的重心已经转移。三年来,各实验室在比拼其最好的模型在最佳状态下的表现。而通过Opus 5,Anthropic正在竞争一些不那么光鲜但利润更丰厚的东西:一个非常优秀的模型每天能做什么,而价格只有一半。在一个前沿不断推进的市场中,Anthropic押注真正的财富就在前沿的后方。