Meta 推出 Muse Code 测试版,Claude Opus 5 在基准测试中领先
要点速览
- •Meta 发布了 Muse Code 测试版,这是一款由 Muse Spark 1.2 模型驱动的终端编程代理;该模型在大多数编程基准中优于 OpenAI 的 Codex 和 Google 的 Antigravity,但在 Meta 公布的每一项基准中都落后于 Anthropic 的 Claude Opus 5。
- •Muse Code 维护本地事件日志,记录所有模型调用、工具运行、批准和编辑,使代理在长时间任务中发生崩溃后也能无缝恢复。
- •该代理可以在隔离工作树中并行拆分多个子代理,因此开发者的工作副本不会被触碰;测试中它曾同时构建六个游戏功能且没有冲突。
- •Meta 并未把重点放在顶级基准表现上,而是转向价格竞争,这与 AI 模型市场中常见的差异化路径一致。
- •代号 Watermelon 的更大 Meta AI 模型仍在训练中,公司已向投资者表示,今年预计将在芯片、数据中心和相关基础设施上支出 1250 亿至 1450 亿美元。

Meta 于周三发布了 Muse Code(测试版),这是一款基于终端的编程代理。此次发布使 Meta 直接与快速增长的 AI 编程工具领域展开竞争——包括 OpenAI 的 Codex、Google 的 Antigravity、Anthropic 的 Claude,以及 Cursor 和 Devin 等独立代理——因为开发者正越来越多地将多文件工程工作交给自主模型。Meta 自己的图表显示,该模型在大多数编程测试中优于 OpenAI 的 Codex 和 Google 的 Antigravity,但在 Meta 公布的每一项基准测试中都落后于 Anthropic 的 Claude Opus 5。
Muse Code 落后于 Opus 5,但增加了可防崩溃日志
Muse Code 由 Muse Spark 1.2 驱动,这是 Meta 在 7 月向美国开发者开放的编程模型更新版本。
在 Meta 展示的基准测试中,Muse Spark 1.2 落后于 Opus 5,但在大多数测试中优于 Codex 和 Antigravity。Meta 将该模型描述为其“迈向前沿的下一步,未来还会有更大、强得多的模型”。
公司表示,在训练期间增加了用于编程任务的计算量之后,Version 1.2 在代码生成、调试以及理解大型代码库方面表现更好。
在一个案例研究中,该模型针对 NVIDIA Hopper 芯片重写 GPU kernels,过程中进行了超过 1,000 次工具调用,持续时间长达 24 小时,并且是在一个被要求不得复制现有库内容的基线之上进行工作。
Muse Code 维护一个本地事件日志,记录所有模型调用、工具运行、批准和编辑。Meta 在其关于该日志的博客文章中写道:“这个单一事实来源使运行时能够精确回放,并且具备重启安全性。”
如果发生崩溃,代理可以从中断处继续。该代理还会让后台子代理在整个会话期间持续运行。Mark Zuckerberg,Meta CEO,在一篇帖子中写道:“当任务足够大时,它会分拆为在隔离工作树中并行工作的多个子代理。”他接着说:“你的工作副本不会被触碰。在测试中,我们让它同时为一款游戏构建六个功能,而且没有发生冲突。”
今天发布 Muse Code 测试版。它是一款终端编程代理,能够处理大型代码仓库中的完整软件工程任务:规划更改、编写代码、验证结果。由 Muse Spark 1.2 提供支持,这是一项面向编程的模型更新。pic.twitter.com/xqavk41w6v — Mark Zuckerberg (@finkd) August 5, 2026
/plan、/grill,以及 Meta 对成本的押注
Muse Code 内置了若干命令。/plan 会将请求转化为一个需要审批的计划,/grill 会对该计划进行压力测试直到其站得住脚,/goal 则推动完成所述目标。
开发者只需使用一个 curl 命令即可在 macOS 或 Linux 上安装该代理。Muse Spark 1.2 也可通过 Meta Model API 使用。
该模型与代理被设计为协同工作,Muse Code 工具集则确保它们保持兼容。
部分训练数据来自更早的 Muse Spark 1.1,该版本用于生成高难度编程问题并对候选答案进行评分。Meta 表示,这一循环帮助新模型更严格地遵循指令。
Meta 告诉投资者,公司预计今年将在芯片、数据中心和其他基础设施上支出 1250 亿至 1450 亿美元。
由于在基准测试中难以追上 Opus 5,公司转而在价格上竞争。这种做法也反映了更广泛的 AI 模型市场趋势:当提供方无法占据最高基准位置时,往往会通过成本、开放性或集成深度来区分自己。代号 Watermelon 的更大 Meta AI 模型仍在训练中。
如果你读到这里,你已经领先一步。订阅我们的新闻通讯,保持领先。