NoticiasAccionesMeta Lanza Muse Glimmer: Un Modelo de Pesos Abiertos de 30B Parámetros Diseñado para Agentes de IA en Dispositivo

Meta Lanza Muse Glimmer: Un Modelo de Pesos Abiertos de 30B Parámetros Diseñado para Agentes de IA en Dispositivo

Autor: Metaverse Post·

Puntos clave

  • Muse Glimmer es un modelo de IA agentic de 30 mil millones de parámetros publicado por Meta bajo la licencia Apache 2.0, que permite uso comercial, modificación y redistribución.
  • El modelo fue entrenado a través de un pipeline de tres fases que utilizó destilación de logits de un modelo maestro más grande llamado Muse Spark, seguido de entrenamiento intermedio con alta densidad de agentes y post-entrenamiento con aprendizaje por refuerzo.
  • Los resultados de benchmarks muestran a Muse Glimmer con un rendimiento competitivo frente a modelos de tamaño similar como Gemma4-31B y Qwen3.6-27B en cargas de trabajo específicas de agentes, incluyendo uso de herramientas en múltiples turnos, QA de búsqueda web y tareas de ingeniería de software.
  • Meta aplicó cuantización de aproximadamente 4 bits para comprimir el modelo a menos de 20 GB, habilitando operación en tiempo real en el dispositivo con hardware de consumo que incluye sistemas MacBook M4-Max, M5-Max y RTX-5090.
  • El modelo soporta entrada multimodal a través de un codificador de percepción dedicado, opera en más de 100 idiomas y es compatible con frameworks de orquestación agentic como OpenClaw.
Meta Lanza Muse Glimmer: Un Modelo de Pesos Abiertos de 30B Parámetros Diseñado para Agentes de IA en Dispositivo

Meta ha publicado Muse Glimmer, un modelo de IA agentic de 30 mil millones de parámetros distribuido bajo la licencia permisiva Apache 2.0, que permite el uso comercial, modificación y redistribución con restricciones mínimas. Desarrollado por Meta Superintelligence Labs, el modelo está diseñado para funcionar como un agente autónomo completamente capaz—manejando planificación, invocación de herramientas, autoverificación y recuperación de fallos—manteniéndose lo suficientemente compacto para ejecutarse localmente en hardware de consumo que requiere tan solo 24 GB de memoria de video.

Los pesos del modelo están disponibles de inmediato en Hugging Face. Las integraciones con motores y plataformas de inferencia de amplio uso—incluyendo Ollama, LM Studio, vLLM, SGLang, Together AI, Fireworks AI y OpenRouter—están programadas para seguir en los próximos días.

El lanzamiento amplía la práctica continua de Meta de liberar como código abierto su investigación fundamental en IA, esta vez dirigida a la creciente demanda de flujos de trabajo de agentes locales y siempre activos que operan sin conectividad en la nube ni infraestructura externa. Ejecutar agentes completamente en el dispositivo elimina los costos de API por token, remueve la latencia de red de los ciclos de razonamiento del agente y evita que los datos sensibles salgan de la máquina del usuario—una combinación importante para despliegues empresariales sensibles a la privacidad, entornos sin conexión y aplicaciones donde la latencia sub-segundo en llamadas a herramientas es crítica. El movimiento también intensifica la competencia en el ecosistema de IA de pesos abiertos, donde la familia Llama de Meta, la línea Gemma de Google, la serie Qwen de Alibaba y los modelos de Mistral compiten por la adopción de los desarrolladores en escenarios de despliegue tanto en la nube como en el borde.

Introducing Muse Glimmer, an open-weight 30B-parameter model optimized for local, always-on agent workflows. Muse Glimmer delivers strong performance on key agentic use cases and benchmarks compared with leading models in its size category, and is designed to run entirely on… pic.twitter.com/mI4z91GPnE
— AI at Meta (@AIatMeta) August 10, 2026

Arquitectura, Entrenamiento y Optimización Local

Muse Glimmer fue construido utilizando una arquitectura a medida y una novedosa receta de destilación diseñada para transferir el razonamiento agentic de un modelo maestro significativamente más grande—referido como Muse Spark—a un factor de forma más eficiente. La destilación se ha convertido en una técnica estándar en el conjunto de herramientas de compresión de modelos, permitiendo que modelos más pequeños aproximen las distribuciones de salida y los patrones de razonamiento de sistemas mucho más grandes. El pipeline de entrenamiento consistió en tres fases:

  1. Pre-entrenamiento mediante destilación de logits en las salidas del modelo maestro.
  2. Entrenamiento intermedio con datos de contexto extendido y alta densidad de agentes, enriquecidos con trazas de razonamiento.
  3. Post-entrenamiento que combina ajuste fino supervisado con destilación on-policy y aprendizaje por refuerzo en dominios generales, de programación y agentic.

El modelo fue evaluado bajo el Advanced AI Scaling Framework de Meta antes de su lanzamiento.

Rendimiento en Benchmarks y Capacidades

Los resultados de benchmarks muestran un rendimiento competitivo en relación con contrapartes de tamaño similar, incluyendo Gemma4-31B y Qwen3.6-27B, en tareas como DeepSearch QA, MCP-Atlas, τ-Bench y SWE-Bench. En particular, el conjunto de evaluación enfatiza cargas de trabajo específicas de agentes—uso de herramientas en múltiples turnos, QA impulsada por búsqueda web y tareas de ingeniería de software del mundo real—en lugar de benchmarks de conocimiento estático, reflejando el cambio más amplio de la industria hacia la medición de modelos en capacidad agentic dinámica en lugar de únicamente en recuperación factual.

Más allá del razonamiento central, Muse Glimmer soporta entrada multimodal a través de un codificador de percepción dedicado, operación multilingüe en más de 100 idiomas y compatibilidad con patrones de orquestación agentic como OpenClaw.

Despliegue Local y Cuantización

Para habilitar el despliegue local práctico, Meta aplicó técnicas de cuantización que comprimen el modelo a aproximadamente precisión de 4 bits, reduciendo su tamaño a menos de 20 GB. Esto deja memoria suficiente para el KV cache, el codificador de imágenes y un drafter ligero de decodificación especulativa basado en DFlash, que propone bloques de tokens en paralelo para acelerar la generación sin alterar la calidad de salida.

Meta validó la configuración en hardware MacBook M4-Max, M5-Max y RTX-5090, reportando velocidades adecuadas para conversación fluida e interacción con el agente en tiempo real completamente en el dispositivo. La elección del hardware de validación abarca Apple Silicon y GPU de consumo de gama alta de NVIDIA, reflejando las dos pilas de inferencia de consumo dominantes y subrayando la intención de Meta de hacer el modelo accesible en las estaciones de trabajo de desarrollador más comunes en lugar de hardware de centro de datos.