AktualnościAkcjeMeta udostępnia Muse Glimmer: model open-weight o 30 miliardach parametrów zaprojektowany dla agentów AI działających na urządzeniach

Meta udostępnia Muse Glimmer: model open-weight o 30 miliardach parametrów zaprojektowany dla agentów AI działających na urządzeniach

Autor: Metaverse Post·

Najważniejsze informacje

  • Muse Glimmer to agenticzny model AI o 30 miliardach parametrów udostępniony przez Meta na licencji Apache 2.0, pozwalającej na wykorzystanie komercyjne, modyfikację i redystrybucję.
  • Model został wytrenowany w trójfazowym potoku, który wykorzystywał destylację logitów z większego modelu nauczyciela o nazwie Muse Spark, a następnie mid-training ukierunkowany na agentów i post-training z uczeniem przez wzmacnianie.
  • Wyniki testów benchmarkowych pokazują, że Muse Glimmer osiąga konkurencyjną wydajność w porównaniu z podobnie wielkimi modelami, takimi jak Gemma4-31B i Qwen3.6-27B, w obciążeniach specyficznych dla agentów, obejmujących wieloetapowe korzystanie z narzędzi, QA z wyszukiwaniem w sieci oraz zadania inżynierii oprogramowania.
  • Meta zastosowała kwantyzację około 4-bitową, aby skompresować model poniżej 20 GB, co umożliwia działanie w czasie rzeczywistym na urządzeniu na sprzęcie konsumenckim, w tym MacBook M4-Max, M5-Max i systemach z RTX-5090.
  • Model obsługuje dane multimodalne za pośrednictwem dedykowanego enkodera percepcji, działa w ponad 100 językach i jest kompatybilny ze strukturami orkiestracji agenticznej, takimi jak OpenClaw.
Meta udostępnia Muse Glimmer: model open-weight o 30 miliardach parametrów zaprojektowany dla agentów AI działających na urządzeniach

Meta udostępniła Muse Glimmer — agenticzny model AI o 30 miliardach parametrów rozpowszechniany na permisywnej licencji Apache 2.0, która pozwala na wykorzystanie komercyjne, modyfikację i redystrybucję przy minimalnych ograniczeniach. Model opracowany przez Meta Superintelligence Labs jest zaprojektowany do działania jako w pełni sprawny agent autonomiczny — obsługujący planowanie, wywoływanie narzędzi, autoweryfikację i odzyskiwanie po awariach — a jednocześnie na tyle kompaktowy, aby uruchamiać się lokalnie na sprzęcie konsumenckim wymagającym zaledwie 24 GB pamięci wideo.

Wagi modelu są natychmiast dostępne na platformie Hugging Face. Integracje z szeroko stosowanymi silnikami i platformami inferencyjnymi — w tym Ollama, LM Studio, vLLM, SGLang, Together AI, Fireworks AI i OpenRouter — mają pojawić się w ciągu najbliższych dni.

Wydanie to jest kontynuacją praktyki Meta w zakresie open-sourcingu podstawowych badań nad sztuczną inteligencją, tym razem ukierunkowaną na rosnący popyt na lokalne, stale aktywne przepływy pracy agentów, które działają bez łączności z chmurą lub zewnętrznej infrastruktury. Uruchamianie agentów w całości na urządzeniu eliminuje koszty API naliczane za token, usuwa opóźnienia sieciowe z pętli rozumowania agenta i zapobiega opuszczaniu przez dane wrażliwe maszyny użytkownika — kombinacja, która ma znaczenie dla wdrożeń korporacyjnych wymagających ochrony prywatności, środowisk offline i aplikacji, w których sub-sekundowe opóźnienie wywoływania narzędzi ma krytyczne znaczenie. Krok ten zaostrza również konkurencję w ekosystemie open-weight AI, gdzie rodzina Llama firmy Meta, linia Gemma firmy Google, seria Qwen firmy Alibaba i modele Mistral rywalizują o przyjęcie przez programistów w scenariuszach wdrożeń zarówno w chmurze, jak i na urządzeniach brzegowych.

Introducing Muse Glimmer, an open-weight 30B-parameter model optimized for local, always-on agent workflows. Muse Glimmer delivers strong performance on key agentic use cases and benchmarks compared with leading models in its size category, and is designed to run entirely on… pic.twitter.com/mI4z91GPnE
— AI at Meta (@AIatMeta) August 10, 2026

Architektura, szkolenie i optymalizacja lokalna

Muse Glimmer został zbudowany z wykorzystaniem dedykowanej architektury oraz nowatorskiej metody destylacji, zaprojektowanej w celu przeniesienia rozumowania agenticznego ze znacznie większego modelu nauczyciela — określanego jako Muse Spark — do bardziej wydajnej formy. Destylacja stała się standardową techniką w zestawie narzędzi kompresji modeli, umożliwiając mniejszym modelom przybliżanie rozkładów wyjściowych i wzorców rozumowania znacznie większych systemów. Potok szkoleniowy składał się z trzech faz:

  1. Pre-training poprzez destylację logitów na podstawie wyników modelu nauczyciela.
  2. Mid-training na danych o rozszerzonym kontekście, intensywnie ukierunkowanych na agentów, wzbogaconych o ślady rozumowania.
  3. Post-training łączący nadzorowane dostrajanie z destylacją on-policy i uczeniem przez wzmacnianie w domenach ogólnej, programistycznej i agenticznej.

Model został oceniony w ramach Meta's Advanced AI Scaling Framework przed udostępnieniem.

Wydajność w testach benchmarkowych i możliwości

Wyniki testów benchmarkowych wykazują konkurencyjną wydajność w stosunku do podobnie wielkich odpowiedników, w tym Gemma4-31B i Qwen3.6-27B, w zadaniach takich jak DeepSearch QA, MCP-Atlas, τ-Bench i SWE-Bench. Co istotne, zestaw ewaluacyjny kładzie nacisk na obciążenia robocze specyficzne dla agentów — wieloetapowe korzystanie z narzędzi, pytania i odpowiedzi sterowane wyszukiwaniem w sieci oraz zadania inżynierii oprogramowania ze świata rzeczywistego — zamiast na statyczne testy wiedzy, co odzwierciedla szerszą zmianę w branży polegającą na mierzeniu modeli pod kątem dynamicznych możliwości agenticznych, a nie wyłącznie odtwarzania faktów.

Oprócz podstawowego rozumowania, Muse Glimmer obsługuje dane multimodalne za pomocą dedykowanego enkodera percepcji, działanie wielojęzyczne w ponad 100 językach oraz kompatybilność ze wzorcami orkiestracji agenticznej, takimi jak OpenClaw.

Wdrożenie lokalne i kwantyzacja

Aby umożliwić praktyczne wdrożenie lokalne, Meta zastosowała techniki kwantyzacji kompresujące model do około 4-bitowej precyzji, co zmniejsza jego ślad poniżej 20 GB. Pozostawia to wystarczającą ilość pamięci dla pamięci podręcznej KV, enkodera obrazu oraz lekkiego draftera dekodowania spekulatywnego opartego na DFlash, który proponuje bloki tokenów równolegle, aby przyspieszyć generowanie bez zmiany jakości wyników.

Meta zweryfikowała konfigurację na sprzęcie MacBook M4-Max, M5-Max i RTX-5090, raportując prędkości odpowiednie do płynnej konwersacji i interakcji z agentem w czasie rzeczywistym w całości na urządzeniu. Wybór sprzętu walidacyjnego obejmuje układy Apple Silicon oraz wysokiej klasy konsumenckie układy GPU firmy NVIDIA, co odzwierciedla dwa dominujące stosy inferencyjne dla konsumentów i podkreśla intencję Meta udostępnienia modelu na najpopularniejszych stacjach roboczych dla programistów, a nie na sprzęcie centrów danych.