Meta 推出 Muse Code AI 程式編寫代理,挑戰 Claude Code 與 OpenAI Codex
重點速覽
- •Meta 已發布 Muse Code 測試版,這是一款由 Muse Spark 1.2 模型驅動的終端機程式編寫代理,可透過 Meta Model API 和 curl 安裝腳本使用。
- •Muse Code 的區別特色是其崩潰安全執行環境,會將每次操作記錄到本地事件日誌中,使代理能在故障後從中斷處精確恢復。
- •在 Meta 自家的基準測試中,Muse Spark 1.2 在所有程式編寫指標上均落後 Anthropic 的 Opus 5,但在多數指標上優於 OpenAI 的 Codex 和 Google 的 Antigravity。
- •Meta 展示了 Muse Code 的長時程能力,讓它在 Nvidia Hopper GPU 上透過超過 1,000 次工具呼叫、長達 24 小時地反覆最佳化 GPU 核心。
- •該代理還提供多模態功能,如演示中所示,它能將一段房屋導覽影片轉換為具備預訂功能的可運作網站。

Meta 已發布 Muse Code(測試版),這是一款以終端機為基礎的程式編寫代理,由該公司更新的程式編寫專用模型 Muse Spark 1.2 驅動。該工具現已透過 Meta Model API 和 curl 安裝腳本提供使用。
Muse Code 可協調持續運作的背景子代理,並維持可精確重播的事件日誌,讓代理在崩潰後能從中斷處精確恢復。
在 Meta 自家的基準測試圖表中,Muse Spark 1.2 在所有展示的程式編寫基準測試中均落後 Anthropic 的 Opus 5,但在多數指標上優於 OpenAI 的 Codex 和 Google 的 Antigravity。
Meta 是最新一家推出專用程式編寫代理的科技巨頭,加入了由 Anthropic 和 OpenAI 主導的競爭領域。此次發布顯示,由 Anthropic 的 Claude Code 所帶起的終端機原生程式編寫代理已成為標準競爭前沿,各大實驗室現在都在推出或開發自己的同類產品。
「我們很高興發布 Muse Code(測試版),這是一款由我們最新模型 Muse Spark 1.2 驅動的終端機程式編寫代理,」該公司在一份官方公告中寫道。「這標誌著我們朝向前沿邁出的下一步,更大、更強大的模型即將到來。」
為大型程式庫工程而生
Muse Code 專為大型程式庫的軟體工程而設計。根據 Meta 的說法,它「能處理跨大型程式庫的複雜軟體工程任務:規劃變更、編寫程式碼並驗證結果。它可以為每個任務協調多個持續運作的子代理,更快、更準確地解決困難問題,且所需的人工介入更少。」
一項突出的特色是其執行架構。Muse Code 將每次模型呼叫、工具執行、審核和編輯都記錄到本地事件日誌中,作為唯一的真實來源。
「這個唯一的真實來源使執行環境具備可精確重播和重啟安全的特性:崩潰後,代理能從中斷處精確恢復,」Meta 表示。對於長時間運行的工程任務,這項能力可能比原始處理速度更為重要——這是競爭產品未曾強調的面向。崩潰恢復力是代理式程式編寫中一個明顯未被充分解決的問題,在這個領域中,數小時的任務可能因單一次執行失敗而中斷。
該代理內建多項預設技能。「/plan」指令可將任務轉換為需經審核的計畫,「/grill」會對該計畫進行壓力測試直到其穩固,而「/goal」則致力於成功完成目標,類似於 Hermes 的功能。Meta 表示,他們將 Muse Spark 1.2 與 Muse Code 進行了共同訓練,使核心 LLM 與代理能協同運作。
基準測試顯示進展,但非領先
Muse Spark 1.2 是 Muse Spark 1.1 的程式編寫專用更新版本。Meta 表示,他們「大幅提升了程式編寫任務的訓練運算量,同時擴展了訓練環境的多樣性,在程式碼生成、複雜除錯和端到端開發者工作流程方面帶來了改善。」
在 Terminal-Bench 2.1 上,Muse Spark 1.2 搭配 Muse Code 獲得 82.9% 的分數,落後於 Claude Code 搭配 Opus 5 的 86.7%,但領先 Codex 上的 GPT-5.6 Terra(81.8%)和 Grok Build(81.6%)。
在衡量代理式程式編寫能力的 DeepSWE 1.1 上,差距較小:Muse 為 59.3%,而 Opus 5 為 65.0%,Codex 為 64.8%。在 Meta 內部程式編寫基準測試中,Muse 達到 70.6%,相比之下 Opus 5 為 79.4%。
加速圖表則呈現了不同排序。在超過 1,000 次工具呼叫的過程中,Opus 5 相較於基準線的提升最大(約 74–75%),而 Muse Spark 1.2 處於中等水準,約在 61–69% 之間,視運行情況而定。Meta 強調,代理會隨著工具呼叫累積而持續改善——這是長時程程式編寫系統應具備的理想行為。
長時程與多模態演示
最引人注目的展示集中在長時程和多模態能力上。在壓力測試中,Meta 表示 Muse Code「在 Nvidia Hopper GPU 上透過超過 1,000 次工具呼叫(長達 24 小時)反覆最佳化 GPU 核心」,展現了在長時間內持續改善效能的能力。
該工具還提供視覺化程式編寫功能。在一項演示中,使用者將一段房屋導覽影片以 mp4 格式拖入終端機,Muse Code「解讀該影片並產生一個視覺豐富、具備預訂功能的網站。」將原始影片轉換為可運作的網頁應用程式,代表了 Meta 在整個 Muse 產品線上持續推進的多模態願景。
請參閱發布串文:
Here's an example of Muse Code's multimodal visual coding capabilities. In this demo, the user inputs a fly-through video of a home into the terminal as an mp4 file. Muse Code interprets the video and produces a visually rich website with booking capabilities. pic.twitter.com/3CAfIMYmAB
— AI at Meta (@AIatMeta) August 5, 2026
競爭激烈的市場
Meta 進入了一個已有成熟玩家的市場。OpenAI 的 Codex 已能運行平行雲端代理;DeepSeek 已打造出自家的 Claude Code 競品;而 Hermes 和 OpenClaw 等代理工具已是功能完善的替代方案,且能力持續擴展。
Muse Code 的區別特徵在於其崩潰安全執行環境和子代理協調架構,而非基準測試的領先地位。對 Meta 而言,策略似乎是主打可靠性和自主性,而非原始模型優勢——押注企業和研究開發者會優先選擇可靠的長時程代理,而非邊際的基準測試提升。
代理式程式編寫的固有風險依然存在:一個在崩潰後恢復並持續呼叫工具長達 24 小時的代理,既強大又難以預測。Meta 押注開發者需要這種程度的自主性。
Muse Code 可在安裝後輸入以下指令進行測試:
curl -fsSL | bash