新闻股票Meta发布Muse Glimmer:专为端侧AI智能体打造的300亿参数开放权重模型

Meta发布Muse Glimmer:专为端侧AI智能体打造的300亿参数开放权重模型

作者: Metaverse Post·

要点速览

  • Muse Glimmer是Meta在Apache 2.0许可证下发布的300亿参数智能体AI模型,允许商业使用、修改和再分发。
  • 该模型通过三阶段训练流程进行训练,使用了来自更大教师模型Muse Spark的logit蒸馏,随后进行了以智能体为中心的中期训练和结合强化学习的后训练。
  • 基准测试结果显示,Muse Glimmer在与Gemma4-31B和Qwen3.6-27B等同等规模模型的对比中,在多轮工具使用、网络搜索问答和软件工程任务等智能体特定工作负载上表现具有竞争力。
  • Meta应用了约4位量化将模型压缩至20 GB以下,使其能够在包括MacBook M4-Max、M5-Max和RTX-5090在内的消费级硬件上实现实时端侧运行。
  • 该模型通过专用感知编码器支持多模态输入,可在100多种语言中运行,并与OpenClaw等智能体编排框架兼容。
Meta发布Muse Glimmer:专为端侧AI智能体打造的300亿参数开放权重模型

Meta发布了Muse Glimmer,一款在宽松的Apache 2.0许可证下分发的300亿参数智能体AI模型,该许可证允许在极少限制下进行商业使用、修改和再分发。该模型由Meta超级智能实验室(Meta Superintelligence Labs)开发,旨在作为完全自主的智能体运行——涵盖规划、工具调用、自我验证和故障恢复——同时保持足够紧凑,可在仅需24 GB显存的消费级硬件上本地运行。

模型权重已在Hugging Face上即时发布。与主流推理引擎和平台的集成——包括Ollama、LM Studio、vLLM、SGLang、Together AI、Fireworks AI和OpenRouter——预计将在未来几天内陆续推出。

此次发布延续了Meta开源基础AI研究的惯例,这一次瞄准的是对本地、常驻式智能体工作流日益增长的需求,这些工作流无需依赖云连接或外部基础设施即可运行。完全在设备上运行智能体消除了按token计算的API成本,去除了智能体推理循环中的网络延迟,并确保敏感数据不会离开用户设备——这一组合对于注重隐私的企业级部署、离线环境以及对亚秒级工具调用延迟有严格要求的应用场景至关重要。此举也加剧了开放权重AI生态系统中的竞争,Meta的Llama系列、Google的Gemma系列、阿里巴巴的Qwen系列以及Mistral的模型在云端和边缘部署场景中争夺开发者采用。

Introducing Muse Glimmer, an open-weight 30B-parameter model optimized for local, always-on agent workflows. Muse Glimmer delivers strong performance on key agentic use cases and benchmarks compared with leading models in its size category, and is designed to run entirely on… pic.twitter.com/mI4z91GPnE
— AI at Meta (@AIatMeta) August 10, 2026

架构、训练与本地优化

Muse Glimmer采用定制架构和新颖的蒸馏方案构建,旨在将来自一个明显更大的教师模型——被称为Muse Spark——的智能体推理能力转移到更高效的形式中。蒸馏已成为模型压缩工具包中的标准技术,使较小的模型能够逼近大得多的系统的输出分布和推理模式。训练流程包含三个阶段:

  1. 预训练:通过教师模型输出的logit蒸馏进行。
  2. 中期训练:在扩展上下文、以智能体为中心的数据上进行,这些数据富含推理轨迹。
  3. 后训练:结合监督微调、策略内蒸馏和强化学习,覆盖通用、编程和智能体领域。

该模型在发布前通过了Meta高级AI扩展框架(Advanced AI Scaling Framework)的评估。

基准测试表现与能力

基准测试结果显示,与同等规模的模型相比——包括Gemma4-31B和Qwen3.6-27B——在DeepSearch QA、MCP-Atlas、τ-Bench和SWE-Bench等任务上表现具有竞争力。值得注意的是,评估套件侧重于智能体特定工作负载——多轮工具使用、网络搜索驱动的问答以及真实世界的软件工程任务——而非静态知识基准,这反映了行业更广泛的转变,即从单纯衡量事实记忆转向衡量模型的动态智能体能力。

除了核心推理能力外,Muse Glimmer还通过专用感知编码器支持多模态输入,可在100多种语言中运行,并与OpenClaw等智能体编排模式兼容。

本地部署与量化

为实现实用的本地部署,Meta应用了量化技术,将模型压缩至约4位精度,使其占用空间降至20 GB以下。这为KV缓存、图像编码器以及基于DFlash的轻量级推测解码草稿器留出了足够的内存,后者通过并行提出token块来加速生成而不改变输出质量。

Meta在MacBook M4-Max、M5-Max和RTX-5090硬件上验证了该配置,报告称速度足以支持流畅对话和完全在设备上的实时智能体交互。验证硬件的选择横跨Apple Silicon和高端NVIDIA消费级GPU,反映了两大主流消费级推理技术栈,凸显了Meta让该模型在最常见的开发者工作站而非数据中心硬件上可用的意图。