Meta推出Muse Code AI编程智能体,对标Claude Code与OpenAI Codex
要点速览
- •Meta已发布Muse Code测试版,这是一款由Muse Spark 1.2模型驱动的终端编程智能体,可通过Meta Model API和curl安装脚本使用。
- •Muse Code的突出特性是崩溃安全运行时,它将每个操作记录到本地事件日志中,使智能体能够在故障后从上次中断处精确恢复。
- •在Meta自身的基准测试中,Muse Spark 1.2在所有编程指标上均落后于Anthropic的Opus 5,但在大多数指标上优于OpenAI的Codex和Google的Antigravity。
- •Meta展示了Muse Code的长时间运行能力:在Nvidia Hopper GPU上通过1,000多次工具调用、长达24小时迭代优化GPU内核。
- •该智能体还提供多模态功能,如在一个演示中将一段房屋漫游视频转换为具备预订功能的可用网站。

Meta已发布Muse Code(测试版),这是一款基于Muse Spark 1.2驱动的终端编程智能体,Muse Spark 1.2是该公司更新的编程专用模型。该工具目前可通过Meta Model API和curl安装脚本使用。
Muse Code可协调持久后台子智能体,并维护精确重放的事件日志,使智能体在崩溃后能够从上次中断处精确恢复。
在Meta自身的基准测试图表中,Muse Spark 1.2在所有展示的编程基准上均落后于Anthropic的Opus 5,但在大多数指标上优于OpenAI的Codex和Google的Antigravity。
Meta是最新一家推出专用编程智能体的科技巨头,加入了由Anthropic和OpenAI主导的竞争领域。此次发布表明,由Anthropic的Claude Code所普及的终端原生编程智能体已成为一个标准的竞争前沿,各大实验室如今都在推出或开发各自的同类产品。
"我们很高兴发布Muse Code(测试版),这是一款由我们最新模型Muse Spark 1.2驱动的终端编程智能体,"该公司在一份官方公告中写道。"这标志着我们迈向前沿的下一步,更大、更强大的模型即将到来。"
面向大型代码库的工程设计
Muse Code专为跨大型代码库的软件工程而设计。据Meta介绍,它"承担跨大型代码库的复杂软件工程任务:规划变更、编写代码并验证结果。它可以为每个任务协调多个持久子智能体,以更快、更准确、更少干预的方式解决难题。"
一项突出的特性是其运行时架构。Muse Code将每次模型调用、工具运行、审批和编辑记录到本地事件日志中,作为唯一的可信数据源。
"这一唯一可信数据源使运行时具备精确重放和重启安全特性:崩溃后,智能体可以精确地从上次中断处恢复,"Meta表示。对于长时间运行的工程任务,这一能力可能比原始处理速度更为重要——而这是竞争产品尚未强调的一个维度。崩溃恢复是智能体编程中一个显著被忽视的问题,多小时任务可能因一次运行时故障而中断。
该智能体附带多项默认技能。"/plan"命令将任务转换为需审批的计划,"/grill"对该计划进行压力测试直到其稳固,而"/goal"则致力于成功完成目标,类似于Hermes的功能。Meta表示,Muse Spark 1.2与Muse Code进行了协同训练,使核心LLM与智能体实现协同运作。
基准测试显示进步,但未达领先
Muse Spark 1.2是Muse Spark 1.1的编程专用更新。Meta表示,其"大幅增加了编程任务的训练算力,同时扩展了训练环境的多样性,在代码生成、复杂调试和端到端开发者工作流程方面带来了改进。"
在Terminal-Bench 2.1上,搭配Muse Code的Muse Spark 1.2得分82.9%,落后于基于Opus 5的Claude Code的86.7%,但领先于基于Codex的GPT-5.6 Terra(81.8%)和Grok Build(81.6%)。
在衡量智能体编程能力的DeepSWE 1.1上,差距更小:Muse为59.3%,Opus 5为65.0%,Codex为64.8%。在Meta内部编程基准上,Muse达到70.6%,而Opus 5为79.4%。
加速比图表则逆转了排名。在超过1,000次工具调用中,Opus 5相对于基线获得了最大提升(约74–75%),而Muse Spark 1.2处于中间水平,根据运行情况约为61–69%。Meta强调,智能体随着工具调用累积而持续改进——这是长时间跨度编程系统所期望的行为。
长时间跨度和多模态演示
最引人注目的演示集中在长时间跨度和多模态能力方面。在压力测试中,Meta表示Muse Code"在Nvidia Hopper GPU上通过1,000多次工具调用(长达24小时)迭代优化了GPU内核,"展示了在长时间运行中持续改进性能的能力。
该工具还提供视觉编程功能。在一个演示中,用户将一段房屋漫游视频以mp4文件形式拖入终端,Muse Code"解读视频并生成一个视觉丰富、具备预订功能的网站。"将原始视频转换为可用的Web应用,体现了Meta在Muse产品线中一直推进的多模态愿景。
参见发布主题帖:
以下是Muse Code多模态视觉编程能力的示例。在此演示中,用户将一段房屋漫游视频以mp4文件形式输入终端。Muse Code解读视频并生成一个视觉丰富、具备预订功能的网站。pic.twitter.com/3CAfIMYmAB
— AI at Meta (@AIatMeta) August 5, 2026
竞争激烈的赛道
Meta进入的是一个已有成熟参与者的市场。OpenAI的Codex已经运行并行云智能体;DeepSeek已构建了自己的Claude Code竞品;而Hermes和OpenClaw等智能体工具已经是功能不断扩展的有效替代方案。
Muse Code的差异化优势在于其崩溃安全运行时和子智能体协调架构,而非基准测试领先地位。对Meta而言,这一策略似乎是以可靠性和自主性取代原始模型主导地位——押注企业和研究开发者将优先选择可靠的长时运行智能体,而非微小的基准测试提升。
智能体编程固有的风险同样适用:一个崩溃后恢复并持续调用工具长达24小时的智能体既强大又不可预测。Meta押注开发者需要这种程度的自主性。
Muse Code可通过安装后输入以下命令进行测试:
curl -fsSL | bash