Anthropic 发布 Claude Fable 5.1,关键基准成绩较前代翻倍以上
要点速览
- •Fable 5.1 在 Terminal-Bench-Science 0.1 上得分 52.6%,是 Fable 5(24.7%)的两倍以上;在 Terminal-Bench 4.0 上得分 55.8%,领先 Opus 5 的 52.3%。
- •缓存读取成本下降 75%,使典型工作负载成本降低约 25%、高度智能体化工作负载最多降低 45%,基础定价维持每百万 token 输入 10 美元、输出 50 美元。
- •Fable 5.1 不包含在 Pro 计划和标准 Team 席位中,这些用户需依赖按用量付费额度;Max 以及高级 Team 或 Enterprise 席位可在每周使用限额的最多 50% 内使用。
- •Mythos 5.1 与 Fable 5.1 共享同一底层模型但安全过滤器不同,访问仅限通过 Anthropic 验证计划审核的网络安全和生命科学专业人士。
- •Fable 5.1 在所有已公布基准上击败 Opus 5,但每 token 成本是后者的两倍:每百万 token 10/50 美元,对比 Opus 5 的 5/25 美元。

Anthropic 于 9 月 1 日发布了 Claude Fable 5.1 和 Claude Mythos 5.1,这是自 6 月 9 日 Fable 5 发布以来该公司对 Mythos 系列模型线的首次更新。新模型在 Terminal-Bench-Science 0.1 上得分 52.6%,对比 Fable 5 的 24.7%;在 Terminal-Bench 4.0 上得分 55.8%,较此前的 42.0% 有所提升。此次发布延续了前沿模型市场的普遍趋势——今年 OpenAI、Google 和 Anthropic 均接连推出旗舰更新,以基准测试的核心分数差作为主要的竞争标尺。
缓存读取成本现在降低了 75%,使典型工作负载成本削减约 25%,高度智能体化(agentic)工作负载最多可降低 45%。基础定价保持不变:每百万 token 输入 10 美元、输出 50 美元。提示缓存(即在每次调用时复用已处理的输入而非重新处理)已成为各大模型提供商的标准成本杠杆,因为智能体化工作流会在多个步骤中重复长上下文,推高账单。
Fable 5.1 不包含在 Pro 计划或标准 Team 席位中,这些用户需通过使用额度运行该模型。Max 计划以及高级 Team 或 Enterprise 席位可在每周限额的最多 50% 内使用该模型。这一分层对开发者选择工作负载的分配方式至关重要:模型实际成本不仅取决于公布的每 token 价格,同样取决于其运行所处的计划。
Anthropic 声称新模型是“全球最先进的编码与知识工作模型”。此次发布处于一个已历经 18 天出口管制停摆、仲夏订阅访问定价之争以及 7 月以低价冲击 Fable 5 的 Claude Opus 5 发布的发布周期中的第三个月。
据 Anthropic 介绍,Fable 5.1 和 Mythos 5.1 是同一底层模型加装不同安全过滤器的版本。Fable 5.1 面向所有持有 Claude 账户的用户开放。Mythos 5.1 则仍通过 Anthropic 的网络安全验证计划(Cyber Verification Program)和生命科学验证计划(Life Sciences Verification Program)限制于经审核的网络安全和生命科学专业人士,这两个计划是此前限制 Mythos 5 访问的 Project Glasswing 通道的后续。
这些基准实际测试的是什么
Anthropic 的核心成绩来自 Terminal-Bench-Science 0.1,该基准测试 AI 智能体能否在命令行环境中执行科学研究任务,以通过率计分。Fable 5.1 取得 52.6%,对比 Fable 5 的 24.7% 和 Opus 5 的 29.0%——是前代的两倍以上。
Terminal-Bench 4.0 测试通过终端执行的智能体化编程——在多步骤命令行会话中编写、运行和调试代码——以正确完成的任务百分比计分。Fable 5.1 得分 55.8%,高于 Fable 5 的 42.0% 和 Opus 5 的 52.3%。对基于终端的多步骤任务的侧重,反映出行业焦点已从单轮对话回答转向能够维持长期自主工作流的智能体——这一转变使智能体基准成为近期前沿模型发布的常用衡量标准。
Mythos 5.1 在较轻的网络安全过滤器下运行,在同一测试中得分 60.9%。Anthropic 表示,这一差距反映了其安全防护拦截并转交 Opus 4.8 处理的任务。
在 Humanity's Last Exam 上——一项由数十个学术领域的专家级问题构建、以通过率计分的多学科推理测试——Fable 5.1 在不使用外部工具时达到 60.9%,使用外部工具时达到 65.0%,均领先于 Opus 5,使其成为 Anthropic 在学术用途上最先进的模型。
它在哪里胜过 Opus 5,以及账目变得模糊之处
Opus 5 于 7 月发布,每 token 价格为 Fable 5 的一半,同时在大多数主要基准上得分超过 Fable 5,实际上使旗舰模型对大多数付费用户而言变得多余。Fable 5.1 扭转了这一局面:它现在在 Anthropic 公布的每一项基准上都击败 Opus 5,包括此前 Opus 5 曾胜过 Fable 5 的那些。
但 Fable 5.1 的每 token 价格仍是 Opus 5 的两倍——输入 10 美元、输出 50 美元,对比 Opus 5 的 5 美元和 25 美元。Token 是模型可处理的基本信息量(通常约为一个英语单词的三分之二),企业之所以按使用量付费,是因为重度工作流通常会很快耗尽订阅计划设定的额度。“价格对性能”的问题——更小、更便宜的模型是否够用——如今是买家在每一家主要提供商的产品线中都会经常面对的问题,而不仅限于 Anthropic。
Anthropic 对该模型的推介侧重于推理努力(effort)等级而非原始分数:该公司表示,以低或中等推理努力运行 Fable 5.1 即可以低得多的成本达到或超过 Fable 5 的旧成绩,同时将最高努力等级保留给其他模型都无法解决的难题。对于日常工作而言,努力档位调得越低,完全跳过 Opus 5 的理由就越不充分。
访问方式沿用了 Anthropic 经数月调整条款后适用于 Fable 5 的同一划分。在 Pro 计划以及标准 Team 或 Enterprise 席位上,Fable 5.1 完全从按 API 费率计费的按用量付费额度中扣除,因为它不计入这些计划的每周限额。在 Max 计划以及高级 Team 或 Enterprise 席位上,它作为订阅的标准部分包含在内,最多可占每周使用量的 50%。
Claude Fable 5.1 现已在 Claude API、Amazon Bedrock、Google Cloud 和 Microsoft Foundry 上线,模型 ID 为 "claude-fable-5-1"(Anthropic)。跨多个云平台的可用性与 Anthropic 历来分发模型的方式一致,让企业客户能够在现有云合同内运行模型,而不必仅通过 Anthropic 自有的 API。