MiMo-V2.6 de Xiaomi cible les agents, la cybersécurité et les mondes 3D dans une version entièrement open-source
Points clés
- •MiMo-V2.6-Pro a décroché la meilleure note parmi les modèles open-source sur l'Artificial Analysis Intelligence Index avec un score de 46,32, dépassant Kimi K3 et Qwen3.8 Max.
- •La série maintient la tarification API au niveau de son prédécesseur V2.5, étendant la frontière intelligence-coût sans augmentation de prix.
- •Sur le benchmark d'ingénierie logicielle DeepSWE v1.1, MiMo-V2.6-Flash est passé de 19,0 (MiMo-V2.5-Pro) à 67,9, tandis que Pro a obtenu 71,9, derrière DeepSeek V4.1 Flash et les leaders Claude et GPT.
- •L'exécution d'apprentissage par renforcement diffusée en direct s'est achevée en moins de six jours sur environ 750 000 trajectoires, pour un coût d'environ 0,85 million de dollars pour Flash et 2,62 millions de dollars pour Pro, avec des gains DeepSWE hors entraînement d'environ 17 et 14 points respectivement.
- •En applications de recherche, MiMo-V2.6-Pro a aidé à formaliser le théorème de Li-Yorke en Lean 4 avec plus de 6 000 lignes de code vérifié par le noyau et a contribué au criblage de nouveaux matériaux MOF pour l'adsorption des PFAS.

Xiaomi a publié et entièrement open-sourcé MiMo-V2.6, la dernière génération de ses modèles d'IA nativement omnimodaux, présentant ce lancement comme une étape clé vers le passage à l'échelle de l'apprentissage par renforcement (RL) sur des tâches complexes et vérifiables. La gamme se compose de deux modèles principaux — MiMo-V2.6-Pro, que l'entreprise décrit comme son modèle le plus performant à ce jour, et le MiMo-V2.6-Flash, plus économe en coûts — auxquels s'ajoute une variante Pro-UltraSpeed offrant des vitesses de sortie jusqu'à 20 fois supérieures.
Sur l'Artificial Analysis Intelligence Index (v4.3, septembre 2026), MiMo-V2.6-Pro a obtenu un score de 46,32, dépassant Kimi K3 et Qwen3.8 Max pour décrocher la meilleure note parmi les modèles open-source. La série conserve également la tarification API de son prédécesseur V2.5, repoussant la frontière de Pareto intelligence-coût à coût inchangé. Elle s'inscrit dans une tendance plus large où les modèles frontière ouverts et fermés sont évalués sur les mêmes benchmarks publics, maintenant le segment open-source en comparaison directe et équivalente avec les systèmes fermés.
Les modèles affichent des résultats compétitifs dans plusieurs disciplines. Sur DeepSWE v1.1, un test d'ingénierie logicielle de longue haleine, MiMo-V2.6-Pro a obtenu 71,9 — derrière DeepSeek V4.1 Flash (74,2) ainsi que Claude Opus 5 et GPT 6 Astra (74,0 chacun) — tandis que MiMo-V2.6-Flash a atteint 67,9, une progression spectaculaire par rapport aux 19,0 de MiMo-V2.5-Pro. Dans les flux de travail agentiques généralistes, la série a dominé Automation Bench v1.0.6 parmi les modèles frontière, à la seule exception de DeepSeek V4.1 Flash, et a enregistré des scores de 94,0 et 95,1 sur le benchmark CyberGym, axé sur la cybersécurité.
Introducing Xiaomi MiMo-V2.6 — Pro & Flash. Frontier intelligence, all the modalities, built in public. Two omnimodal models, advancing through scaled reinforcement learning Pro performs on par with Claude Opus 5 and GPT-5.6 across most agent benchmarks Pro scores… pic.twitter.com/oqfYPC00uK
— Xiaomi MiMo (@XiaomiMiMo) September 21, 2026
Un apprentissage par renforcement à grande échelle, diffusé en public
Le socle technique de cette version est une exécution d'entraînement RL à grande échelle que Xiaomi a diffusée en direct. En moins de six jours, chaque modèle a complété 30 étapes RL couvrant environ 750 000 trajectoires, pour des coûts d'environ 0,85 million de dollars pour Flash et 2,62 millions de dollars pour Pro. Les taux de réussite moyens sur les tâches d'entraînement ont augmenté de 25 % et 12 % en termes relatifs, et les gains sur les benchmarks hors entraînement ont été substantiels : les scores DeepSWE v1.1 ont progressé d'environ 17 points pour Flash (de 48,8 à 65,68) et de 14 points pour Pro (de 58,4 à 72,57). Selon l'entreprise, le processus RL s'est révélé efficace en termes d'échantillons et a généralisé au-delà de la distribution d'entraînement.
Le passage à l'échelle s'est appuyé sur trois axes : des lots plus importants sur une architecture entièrement asynchrone (1 568 échantillons par mise à jour, des longueurs de contexte allant jusqu'à 1 million, et 3,5 à 3,7 milliards de tokens par étape) ; une suite multi-tâches couvrant le codage, les agents généralistes et les domaines visuel et cyber ; et une puissance de calcul accrue pour l'évaluation, utilisant des comparaisons relatives afin de produire des signaux de récompense plus précis. L'équipe a également figé le routeur pour limiter la dérive d'entraînement et déployé une défense contre le reward hacking combinant conception des récompenses, évaluation adversaire, détection d'anomalies et vérification croisée.
Au-delà des benchmarks, Xiaomi met en avant des capacités appliquées sous ce qu'il appelle « Vibe World » — étendant la programmation en langage naturel du logiciel aux mondes 3D interactifs, au développement de jeux, à la modélisation 3D basée sur Blender, au contrôle en boucle fermée de bras robotiques, à la conception front-end et de présentations, ainsi qu'à la production vidéo et musicale de bout en bout. En contexte de recherche, MiMo-V2.6-Pro a contribué au criblage computationnel de nouveaux matériaux MOF pour l'adsorption des PFAS et a aidé à formaliser le théorème de Li–Yorke en Lean 4, produisant plus de 6 000 lignes de code vérifié par le noyau sans aucun post-entraînement spécifique à Lean. Le résultat en Lean 4 illustre l'accent affiché de cette version sur les tâches vérifiables, le noyau de l'assistant de preuve — et non un relecteur humain — confirmant le résultat généré.
Les modèles sont accessibles via la plateforme API MiMo, AI Studio, MiMo Desktop et OpenRouter, avec une tarification inchangée par rapport à V2.5. Xiaomi open-source également le rapport technique complet, les environnements d'entraînement et le code RL pour permettre la reproduction et de recherches ultérieures. Les reproductions indépendantes de l'exécution de six jours et les vérifications tierces des scores annoncés constituent les prochains points à surveiller à mesure que la version se diffuse.
Source : Metaverse Post