NieuwsAandelenMeta lanceert Muse Glimmer: een open-weight model met 30 miljard parameters, gebouwd voor AI-agents op het apparaat zelf

Meta lanceert Muse Glimmer: een open-weight model met 30 miljard parameters, gebouwd voor AI-agents op het apparaat zelf

Auteur: Metaverse Post·

Belangrijkste punten

  • Muse Glimmer is een agentisch AI-model met 30 miljard parameters dat door Meta is uitgebracht onder de Apache 2.0-licentie, met toestemming voor commercieel gebruik, aanpassing en herdistributie.
  • Het model is getraind via een driestaps-pijplijn met logitdistillatie van een groter teachermodel, Muse Spark, gevolgd door mid-training met agentgerichte data en post-training met reinforcement learning.
  • Benchmarkresultaten laten zien dat Muse Glimmer competitief presteert ten opzichte van vergelijkbaar grote modellen zoals Gemma4-31B en Qwen3.6-27B op agent-specifieke workloads, waaronder meerturnig toolgebruik, webzoek-QA en software-engineeringtaken.
  • Meta paste ongeveer 4-bit-kwantisatie toe om het model te comprimeren tot onder 20 GB, waardoor realtime werking op het apparaat mogelijk is op consumentenharde zoals MacBook M4-Max, M5-Max en RTX-5090-systemen.
  • Het model ondersteunt multimodale invoer via een speciale perception encoder, werkt in meer dan 100 talen en is compatibel met agentische orkestratiekaders zoals OpenClaw.
Meta lanceert Muse Glimmer: een open-weight model met 30 miljard parameters, gebouwd voor AI-agents op het apparaat zelf

Meta heeft Muse Glimmer uitgebracht, een agentisch AI-model met 30 miljard parameters dat wordt verspreid onder de permissieve Apache 2.0-licentie, die commercieel gebruik, aanpassing en herdistributie met minimale beperkingen toestaat. Het model is ontwikkeld door Meta Superintelligence Labs en ontworpen om te functioneren als een volledig capabele autonome agent—met planning, tool-invoking, zelfverificatie en herstel na fouten—terwijl het compact genoeg blijft om lokaal te draaien op consumentenharde met slechts 24 GB videogeheugen.

De modelgewichten zijn direct beschikbaar op Hugging Face. Integraties met veelgebruikte inferentie-engines en platforms, waaronder Ollama, LM Studio, vLLM, SGLang, Together AI, Fireworks AI en OpenRouter, volgen naar verwachting in de komende dagen.

De release zet Meta’s voortdurende praktijk voort om fundamenteel AI-onderzoek open source te maken, ditmaal gericht op de groeiende vraag naar lokale, altijd-actieve agent-workflows die niet afhankelijk zijn van cloudconnectiviteit of externe infrastructuur. Agents volledig op het apparaat laten draaien elimineert kosten per token voor API’s, haalt netwerklatentie uit de redeneerlussen van agents en voorkomt dat gevoelige gegevens het apparaat van de gebruiker verlaten—een combinatie die relevant is voor privacygevoelige zakelijke implementaties, offline omgevingen en toepassingen waarbij latentie van tool-aanroepen van minder dan een seconde kritisch is. De stap intensiveert ook de concurrentie in het open-weight-AI-ecosysteem, waarin Meta’s Llama-familie, Google’s Gemma-lijn, Alibaba’s Qwen-serie en Mistral’s modellen strijden om adoptie door ontwikkelaars in zowel cloud- als edge-scenario’s.

Introducing Muse Glimmer, an open-weight 30B-parameter model optimized for local, always-on agent workflows. Muse Glimmer delivers strong performance on key agentic use cases and benchmarks compared with leading models in its size category, and is designed to run entirely on… pic.twitter.com/mI4z91GPnE
— AI at Meta (@AIatMeta) August 10, 2026

Architectuur, training en lokale optimalisatie

Muse Glimmer is gebouwd met een op maat gemaakte architectuur en een nieuw distillatierecept dat bedoeld is om agentisch redeneren over te dragen van een aanzienlijk groter teachermodel—Muse Spark genoemd—naar een efficiëntere vormfactor. Distillatie is een standaardtechniek geworden in de toolkit voor modelcompressie, waarmee kleinere modellen de outputverdelingen en redeneermodellen van veel grotere systemen kunnen benaderen. De trainingspijplijn bestond uit drie fasen:

  1. Pre-training via logitdistillatie op de output van het teachermodel.
  2. Mid-training op data met uitgebreide context en veel agenttaken, verrijkt met redeneertraces.
  3. Post-training waarbij supervised fine-tuning werd gecombineerd met on-policy distillatie en reinforcement learning over algemene, codeer- en agentische domeinen.

Het model werd vóór de release geëvalueerd onder Meta’s Advanced AI Scaling Framework.

Benchmarkprestaties en mogelijkheden

Benchmarkresultaten laten competitieve prestaties zien ten opzichte van vergelijkbare modellen, waaronder Gemma4-31B en Qwen3.6-27B, op taken zoals DeepSearch QA, MCP-Atlas, τ-Bench en SWE-Bench. Opvallend is dat de evaluatieset zich richt op agent-specifieke workloads—meerturnig toolgebruik, QA op basis van webzoekopdrachten en realistische software-engineeringtaken—in plaats van statische kennismodellen, wat de bredere verschuiving in de sector weerspiegelt naar het meten van dynamische agentische capaciteiten in plaats van alleen feitelijke recall.

Naast kernredenering ondersteunt Muse Glimmer multimodale invoer via een speciale perception encoder, meertalige werking in meer dan 100 talen en compatibiliteit met agentische orkestratiepatronen zoals OpenClaw.

Lokale implementatie en kwantisatie

Om praktische lokale implementatie mogelijk te maken, paste Meta kwantisatietechnieken toe die het model comprimeren tot ongeveer 4-bit precisie, waardoor de omvang onder 20 GB uitkomt. Hierdoor blijft voldoende geheugen over voor de KV-cache, de image encoder en een lichte speculative-decoding drafter op basis van DFlash, die tokenblokken parallel voorstelt om generatie te versnellen zonder de uitvoerkwaliteit te wijzigen.

Meta valideerde de opzet op MacBook M4-Max-, M5-Max- en RTX-5090-hardware en rapporteerde snelheden die geschikt zijn voor vloeiende gesprekken en realtime agentinteractie volledig op het apparaat. De gekozen validatiehardware bestrijkt Apple Silicon en high-end NVIDIA-consumenten-GPU’s, wat de twee dominante consumenten-inferentiestacks weerspiegelt en onderstreept dat Meta het model toegankelijk wil maken op de meest gangbare ontwikkelaarswerkstations in plaats van op datacenterhardware.