Meta 發布 Muse Glimmer:專為裝置端 AI 代理打造的 30B 參數開放權重模型
重點速覽
- •Muse Glimmer 是一款由 Meta 以 Apache 2.0 授權發布的 300 億參數智能代理 AI 模型,允許商業使用、修改及再分發。
- •該模型透過三階段訓練流程進行訓練,使用了來自更大教師模型 Muse Spark 的 logit 蒸餾,隨後進行以代理為主的中期訓練以及結合強化學習的後訓練。
- •基準測試結果顯示,Muse Glimmer 在多輪工具使用、網頁搜尋問答及軟體工程任務等代理專屬工作負載上,與 Gemma4-31B 和 Qwen3.6-27B 等同等規模模型表現不相上下。
- •Meta 套用了約 4 位元量化將模型壓縮至 20 GB 以下,使 MacBook M4-Max、M5-Max 及 RTX-5090 等消費級硬體能夠進行即時的裝置端運行。
- •該模型透過專用感知編碼器支援多模態輸入,可在超過 100 種語言中運作,並與 OpenClaw 等智能代理編排框架相容。

Meta 發布了 Muse Glimmer,這是一款以寬鬆的 Apache 2.0 授權分發的 300 億參數智能代理 AI 模型,允許商業使用、修改及再分發,限制極少。該模型由 Meta 超級智能實驗室開發,旨在作為完全自主的代理運作——涵蓋規劃、工具呼叫、自我驗證及故障恢復——同時保持足夠精簡,可在僅需 24 GB 視訊記憶體的消費級硬體上本地運行。
模型權重已於 Hugging Face 上即時提供。與 Ollama、LM Studio、vLLM、SGLang、Together AI、Fireworks AI 及 OpenRouter 等廣泛使用的推論引擎和平台的整合,預計將在未來幾天內陸續推出。
此次發布延續了 Meta 開源基礎 AI 研究的一貫做法,這次的目標是針對不依賴雲端連線或外部基礎設施的本地、常駐型代理工作流程日益增長的需求。完全在裝置端運行代理可消除按 token 計算的 API 成本,移除代理推理迴圈中的網路延遲,並確保敏感資料不會離開使用者的機器——這些優勢對於重視隱私的企業部署、離線環境,以及需要次秒級工具呼叫延遲的應用場景至關重要。此舉也加劇了開放權重 AI 生態系統中的競爭,其中 Meta 的 Llama 系列、Google 的 Gemma 陣容、阿里巴巴的 Qwen 系列以及 Mistral 的模型正在雲端和邊緣部署場景中爭奪開發者的青睞。
Introducing Muse Glimmer, an open-weight 30B-parameter model optimized for local, always-on agent workflows. Muse Glimmer delivers strong performance on key agentic use cases and benchmarks compared with leading models in its size category, and is designed to run entirely on… pic.twitter.com/mI4z91GPnE
— AI at Meta (@AIatMeta) August 10, 2026
架構、訓練與本地最佳化
Muse Glimmer 採用客製化架構和新穎的蒸餾方法構建,旨在將來自顯著更大的教師模型——稱為 Muse Spark——的智能代理推理能力轉移至更高效的形態。蒸餾已成為模型壓縮工具箱中的標準技術,使較小的模型能夠近似更大系統的輸出分佈和推理模式。訓練流程分為三個階段:
- 預訓練:透過對教師模型輸出進行 logit 蒸餾。
- 中期訓練:在擴充上下文、以代理為主的資料上進行,並以推理軌跡加以豐富。
- 後訓練:結合監督式微調、策略蒸餾與強化學習,涵蓋通用、程式編寫及智能代理領域。
模型在發布前於 Meta 的 Advanced AI Scaling Framework 下進行了評估。
基準測試效能與能力
基準測試結果顯示,在 DeepSearch QA、MCP-Atlas、τ-Bench 及 SWE-Bench 等任務上,Muse Glimmer 與同等規模的模型——包括 Gemma4-31B 和 Qwen3.6-27B——相比表現具競爭力。值得注意的是,評測套件強調代理專屬工作負載——多輪工具使用、網頁搜尋驅動的問答以及真實世界的軟體工程任務——而非靜態知識基準,反映了業界從單純測量事實回憶轉向衡量模型動態智能代理能力的更廣泛趨勢。
除核心推理外,Muse Glimmer 透過專用的感知編碼器支援多模態輸入,可在超過 100 種語言中進行多語言運作,並與 OpenClaw 等智能代理編排模式相容。
本地部署與量化
為實現實用的本地部署,Meta 套用了量化技術,將模型壓縮至約 4 位元精度,將其佔用空間縮減至 20 GB 以下。這為 KV 快取、影像編碼器以及基於 DFlash 的輕量級推測解碼草稿器留出了足夠的記憶體,該草稿器以並行方式提出 token 區塊,以加速生成而不改變輸出品質。
Meta 在 MacBook M4-Max、M5-Max 及 RTX-5090 硬體上驗證了此設定,報告指出其速度足以支援流暢對話和完全在裝置端進行的即時代理互動。驗證硬體的選擇涵蓋了 Apple Silicon 和高階 NVIDIA 消費級 GPU,反映了兩大主流消費級推論技術堆疊,凸顯了 Meta 讓模型在最常見的開發者工作站上(而非資料中心硬體上)均可使用的意圖。