新聞股票Meta 推出 Muse Code 測試版,Claude Opus 5 在基準測試中保持領先

Meta 推出 Muse Code 測試版,Claude Opus 5 在基準測試中保持領先

作者: Cryptopolitan·

重點速覽

  • Meta 發布了 Muse Code 測試版,這是一款基於終端機的程式編寫代理,由 Muse Spark 1.2 模型驅動。該模型在大多數程式編寫基準測試中優於 OpenAI 的 Codex 和 Google 的 Antigravity,但在 Meta 發布的所有基準測試中均落後於 Anthropic 的 Claude Opus 5。
  • Muse Code 維護一個本地事件日誌,記錄所有模型呼叫、工具執行、審核批准和編輯操作,使代理能夠在長時間任務中發生崩潰後無縫恢復。
  • 該代理可以在隔離的工作樹中展開平行子代理,確保開發者的工作副本永遠不會被觸碰,如示範中同時建立六個遊戲功能而無衝突所示。
  • Meta 在價格而非頂尖基準測試表現上競爭,反映了市場的更廣泛趨勢,即無法宣稱基準測試領先的提供者轉而在成本、開放性或整合上尋求差異化。
  • 代號 Watermelon 的更大 Meta AI 模型仍在訓練中,該公司已告知投資者預計今年將在晶片、資料中心和相關基礎設施上投入 1,250 億至 1,450 億美元。
Meta 推出 Muse Code 測試版,Claude Opus 5 在基準測試中保持領先

Meta 於週三發布了 Muse Code(測試版),這是一款基於終端機的程式編寫代理。此次發布使 Meta 直接與快速成長的 AI 程式編寫工具領域競爭——包括 OpenAI 的 Codex、Google 的 Antigravity、Anthropic 的 Claude,以及 Cursor 和 Devin 等獨立代理——因為開發者越來越傾向將多檔案工程工作交由自主模型處理。Meta 自己的圖表顯示,該模型在大多數程式編寫測試中優於 OpenAI 的 Codex 和 Google 的 Antigravity,但在 Meta 發布的所有基準測試中均落後於 Anthropic 的 Claude Opus 5。

Muse Code 落後 Opus 5 但新增崩潰安全日誌

Muse Code 由 Muse Spark 1.2 驅動,這是 Meta 於 7 月向美國開發者開放的程式編寫模型的更新版本。

在 Meta 提出的基準測試中,Muse Spark 1.2 落後於 Opus 5,但在大多數測試中擊敗 Codex 和 Antigravity。Meta 將該模型描述為其「邁向前沿的下一步,更大且更強大的模型即將推出。」

該公司表示,在訓練過程中增加了用於程式編寫任務的運算資源後,1.2 版在程式碼生成、除錯和理解大型程式庫方面的表現更加出色。

在一項案例研究中,該模型透過超過 1,000 次工具呼叫,耗時長達 24 小時,為 NVIDIA Hopper 晶片重寫了 GPU 核心程式,其工作基線被要求不得從現有函式庫複製。

Muse Code 維護一個本地事件日誌,記錄所有模型呼叫、工具執行、審核批准和編輯操作。「這個單一資訊來源使執行階段能夠精確重播且可安全重啟,」Meta 在其部落格文章中關於該日誌寫道。

如果發生崩潰,代理可以從中斷處恢復執行。該代理還會在整個工作階段中保持背景子代理運行。這種恢復能力對於長時間執行的任務至關重要,因為單次失敗可能會導致數小時的運算成本損失。

Meta 執行長 Mark Zuckerberg 在一篇文章中寫道:「當任務規模夠大時,它會分散到獨立的子代理,在隔離的工作樹中平行運作。」他補充道:「你的工作副本永遠不會被觸碰。在測試中,我們讓它同時為一款遊戲建立六個功能,完全沒有衝突。」

Releasing Muse Code in beta today. It's a terminal coding agent that takes on complete software engineering tasks across large repos: planning changes, writing code, validating the results. Powered by Muse Spark 1.2, a coding-focused model update. pic.twitter.com/xqavk41w6v — Mark Zuckerberg (@finkd) August 5, 2026

/plan、/grill 與 Meta 的成本策略

Muse Code 包含多個內建指令。/plan 將請求轉換為需經審核批准的計畫,/grill 對該計畫進行壓力測試直到通過,/goal 則推動實現既定目標。

開發者可以透過單一 curl 指令在 macOS 或 Linux 上安裝該代理。Muse Spark 1.2 也可透過 Meta Model API 使用。

模型和代理被設計為協同運作,Muse Code 工具集確保兩者之間的相容性。

部分訓練資料來自舊版 Muse Spark 1.1,它負責生成困難的程式編寫問題並為候選答案評分。Meta 表示,這個循環幫助新模型更精確地遵循指令。

Meta 告訴投資者,預計今年將在晶片、資料中心和其他基礎設施上投入 1,250 億至 1,450 億美元。

由於在基準測試中無法超越 Opus 5,該公司轉而在價格上競爭。這一策略反映了 AI 模型市場的更廣泛趨勢,即無法宣稱基準測試第一的提供者轉而在成本、開放性或整合深度上尋求差異化。一款更大的 Meta AI 模型,代號 Watermelon,仍在訓練中。

如果你正在閱讀本文,你已經領先一步。透過我們的電子報保持領先。