NoticiasAccionesMiMo-V2.6 de Xiaomi apunta a agentes, ciberseguridad y mundos 3D en un lanzamiento totalmente de código abierto

MiMo-V2.6 de Xiaomi apunta a agentes, ciberseguridad y mundos 3D en un lanzamiento totalmente de código abierto

Autor: Metaverse Post·

Puntos clave

  • •MiMo-V2.6-Pro reclamó la calificación más alta entre los modelos de código abierto en el Artificial Analysis Intelligence Index con una puntuación de 46.32, superando a Kimi K3 y Qwen3.8 Max.
  • •La serie mantiene los precios de API en los niveles de su predecesor V2.5, extendiendo la frontera entre inteligencia y costo sin aumentar precios.
  • •En el benchmark de ingeniería de software DeepSWE v1.1, MiMo-V2.6-Flash saltó a 67.9 desde el 19.0 de MiMo-V2.5-Pro, mientras que Pro obtuvo 71.9, por detrás de DeepSeek V4.1 Flash y los líderes Claude y GPT.
  • •La ejecución de aprendizaje por refuerzo transmitida en vivo finalizó en menos de seis días a lo largo de unas 750,000 trayectorias, con un costo de aproximadamente 0.85 millones de dólares para Flash y 2.62 millones de dólares para Pro, y ganancias en DeepSWE no visto de unos 17 y 14 puntos respectivamente.
  • •En aplicaciones de investigación, MiMo-V2.6-Pro ayudó a formalizar el teorema de Li-Yorke en Lean 4 con más de 6,000 líneas de código verificado por el kernel y contribuyó al filtrado de nuevos materiales MOF para la adsorción de PFAS.
MiMo-V2.6 de Xiaomi apunta a agentes, ciberseguridad y mundos 3D en un lanzamiento totalmente de código abierto

Xiaomi ha lanzado y liberado por completo como código abierto MiMo-V2.6, la más reciente generación de sus modelos de IA omnimodales nativos, presentando el lanzamiento como un paso clave hacia el escalamiento del aprendizaje por refuerzo (RL) en tareas complejas y verificables. La línea consiste en dos modelos principales — MiMo-V2.6-Pro, que la empresa describe como su modelo más capaz hasta la fecha, y el más eficiente en costos MiMo-V2.6-Flash — acompañados de una variante Pro-UltraSpeed que ofrece velocidades de salida hasta 20 veces más rápidas.

En el Artificial Analysis Intelligence Index (v4.3, septiembre de 2026), MiMo-V2.6-Pro obtuvo una puntuación de 46.32, superando a Kimi K3 y Qwen3.8 Max para reclamar la calificación más alta entre los modelos de código abierto. La serie también mantiene los precios de API de su predecesor V2.5, desplazando hacia afuera la frontera de Pareto entre inteligencia y costo sin aumentar los precios. Forma parte de un patrón más amplio en el que modelos frontera abiertos y cerrados se evalúan en los mismos benchmarks públicos, manteniendo el nivel de código abierto en comparación directa y equivalente con los sistemas cerrados.

Los modelos muestran resultados competitivos en benchmarks en diversas disciplinas. En DeepSWE v1.1, una prueba de ingeniería de software de largo plazo, MiMo-V2.6-Pro obtuvo 71.9 — por detrás de DeepSeek V4.1 Flash (74.2) y de Claude Opus 5 y GPT 6 Astra (74.0 cada uno) — mientras que MiMo-V2.6-Flash alcanzó 67.9, un salto dramático frente al 19.0 de MiMo-V2.5-Pro. En flujos de trabajo agentivos generales, la serie lideró Automation Bench v1.0.6 entre los modelos frontera con la única excepción de DeepSeek V4.1 Flash, y registró puntuaciones de 94.0 y 95.1 en el benchmark CyberGym, enfocado en ciberseguridad.

Introducing Xiaomi MiMo-V2.6 — Pro & Flash. Frontier intelligence, all the modalities, built in public. Two omnimodal models, advancing through scaled reinforcement learning Pro performs on par with Claude Opus 5 and GPT-5.6 Sol across most agent benchmarks Pro scores… pic.twitter.com/oqfYPC00uK

— Xiaomi MiMo (@XiaomiMiMo) September 21, 2026

Aprendizaje por refuerzo a gran escala, transmitido en público

La columna vertebral técnica del lanzamiento es una ejecución de entrenamiento de RL a escala que Xiaomi transmitió en vivo. En menos de seis días, cada modelo completó 30 pasos de RL a lo largo de unas 750,000 trayectorias, con costos de aproximadamente 0.85 millones de dólares para Flash y 2.62 millones de dólares para Pro. Las tasas de aprobación promedio en las tareas de entrenamiento aumentaron un 25% y un 12% en términos relativos, respectivamente, y las ganancias en benchmarks no vistos durante el entrenamiento fueron sustanciales: las puntuaciones de DeepSWE v1.1 subieron unos 17 puntos para Flash (de 48.8 a 65.68) y 14 puntos para Pro (de 58.4 a 72.57). Según la empresa, el proceso de RL demostró ser eficiente en muestras y generalizó más allá de la distribución de entrenamiento.

El escalamiento se siguió a lo largo de tres ejes: lot más grandes en una arquitectura completamente asíncrona (1,568 muestras por actualización, longitudes de contexto de hasta 1 millón y 3.5–3.7 mil millones de tokens por paso); un conjunto multitarea que abarca codificación, agentes generales y dominios visual y de ciberseguridad; y mayor capacidad de cómputo del evaluador que utiliza comparaciones relativas para producir señales de recompensa más precisas. El equipo también congeló el router para frenar la deriva de entrenamiento y desplegó una defensa contra el reward hacking que combina diseño de recompensas, evaluación adversarial, detección de anomalías y verificación cruzada.

Más allá de los benchmarks, Xiaomi exhibe capacidades aplicadas bajo lo que llama “Vibe World,” extendiendo la programación en lenguaje natural del software hacia mundos 3D interactivos, desarrollo de videojuegos, modelado 3D basado en Blender, control de bucle cerrado de brazos robóticos, diseño de frontend y presentaciones, y producción integral de video y música. En entornos de investigación, MiMo-V2.6-Pro contribuyó al filtrado computacional de nuevos materiales MOF para la adsorción de PFAS y ayudó a formalizar el teorema de Li–Yorke en Lean 4, generando más de 6,000 líneas de código verificado por el kernel sin ningún posentrenamiento específico de Lean. El resultado en Lean 4 ilustra el enfoque declarado del lanzamiento en tareas verificables, siendo el kernel del asistente de pruebas — y no un revisor humano — quien confirma la salida generada.

Los modelos están disponibles a través de la Plataforma API de MiMo, AI Studio, MiMo Desktop y OpenRouter, con precios sin cambios respecto a V2.5. Xiaomi también está liberando como código abierto el informe técnico completo, los entornos de entrenamiento y el código de RL para permitir la reproducción y una mayor investigación. Las reproducciones independientes de la ejecución de seis días y las verificaciones de terceros de las puntuaciones reportadas son los siguientes pasos a observar a medida que el lanzamiento circula.

Fuente: Metaverse Post