Xiaomi's MiMo-V2.6 richt zich op agents, cybersecurity en 3D-werelden in volledig open-source release
Belangrijkste punten
- •MiMo-V2.6-Pro behaalde met een score van 46,32 de hoogste waardering onder open-source modellen op de Artificial Analysis Intelligence Index, voorbij Kimi K3 en Qwen3.8 Max.
- •De serie houdt de API-prijzen op het niveau van de V2.5-voorganger en verschuift daarmee de grens tussen intelligentie en kosten zonder prijzen te verhogen.
- •Op de DeepSWE v1.1 software-engineeringbenchmark sprong MiMo-V2.6-Flash van 19,0 (MiMo-V2.5-Pro) naar 67,9, terwijl Pro 71,9 scoorde, achter DeepSeek V4.1 Flash en de leidende Claude- en GPT-modellen.
- •De live uitgezonden reinforcement learning-run werd in minder dan zes dagen voltooid over zo'n 750.000 trajecten, tegen kosten van ongeveer $0,85 miljoen voor Flash en $2,62 miljoen voor Pro, met DeepSWE-verbeteringen van respectievelijk circa 17 en 14 punten.
- •In onderzoeksomgevingen hielp MiMo-V2.6-Pro de stelling van Li-Yorke te formaliseren in Lean 4 met meer dan 6.000 regels kernelgeverifieerde code en droeg het bij aan de screening van nieuwe MOF-materialen voor PFAS-adsorptie.

Xiaomi heeft MiMo-V2.6 uitgebracht en volledig open-source gemaakt, de nieuwste generatie van zijn van nature omnimodale AI-modellen, en presenteert de lancering als een belangrijke stap richting het opschalen van reinforcement learning (RL) op verifieerbare, complexe taken. De serie bestaat uit twee kernmodellen — MiMo-V2.6-Pro, door het bedrijf omschreven als zijn krachtigste model tot nu toe, en het kostenefficiëntere MiMo-V2.6-Flash — aangevuld met een Pro-UltraSpeed-variant die outputsnelheden tot wel 20 keer sneller levert.
Op de Artificial Analysis Intelligence Index (v4.3, september 2026) behaalde MiMo-V2.6-Pro een score van 46,32 en ging daarmee Kimi K3 en Qwen3.8 Max voorbij om de hoogste waardering onder open-source modellen op te eisen. De serie behoudt ook de API-prijzen van zijn V2.5-voorganger, waardoor de Pareto-grens tussen intelligentie en kosten naar buiten wordt geschoven bij onveranderde kosten. Het past in een breder patroon waarin open en gesloten frontier-modellen op dezelfde openbare benchmarks worden beoordeeld, waardoor de open-source categorie in directe, gelijkwaardige vergelijking staat met gesloten systemen.
De modellen presteren concurrerend op uiteenlopende vakgebieden. Op DeepSWE v1.1, een langetermijntest voor software-engineering, scoorde MiMo-V2.6-Pro 71,9 — achter DeepSeek V4.1 Flash (74,2) en zowel Claude Opus 5 als GPT 6 Astra (beide 74,0) — terwijl MiMo-V2.6-Flash 67,9 bereikte, een sprong ten opzichte van MiMo-V2.5-Pro's 19,0. In algemene agentische workflows leidde de serie Automation Bench v1.0.6 onder frontier-modellen, met als enige uitzondering DeepSeek V4.1 Flash, en behaalde het scores van 94,0 en 95,1 op de op cybersecurity gerichte CyberGym-benchmark.
Introducing XiaomiMo-V2.6 — Pro & Flash. Frontier intelligence, all the modalities, built in public. Two omnimodal models, advancing through scaled reinforcement learning Pro performs on par with Claude Opus 5 and GPT-5.6 Sol across most agent benchmarks Pro scores… pic.twitter.com/oqfYPC00uK
— Xiaomi MiMo (@XiaomiMiMo) September 21, 2026
Reinforcement Learning op Schaal, Live Uitgezonden
De technische ruggengraat van de release is een opgeschaalde RL-trainingsrun die Xiaomi live uitzond. In minder dan zes dagen voltooiden beide modellen elk 30 RL-stappen over ongeveer 750.000 trajecten, tegen kosten van circa $0,85 miljoen voor Flash en $2,62 miljoen voor Pro. De gemiddelde slagingspercentages op trainingstaken stegen relatief met 25% respectievelijk 12%, en de verbeteringen op buiten-training gehouden benchmarks waren aanzienlijk: de DeepSWE v1.1-scores stegen met circa 17 punten voor Flash (48,8 naar 65,68) en 14 punten voor Pro (58,4 naar 72,57). Volgens het bedrijf bleek het RL-proces sample-efficiënt en generaliseerde het buiten de trainingsdistributie.
Het opschalen gebeurde langs drie assen: grotere batches op een volledig asynchrone architectuur (1.568 samples per update, contextlengtes tot 1 miljoen en 3,5–3,7 miljard tokens per stap); een multi-task suite die codering, algemene agents, visuele en cyberdomeinen omvat; en meer rekencapaciteit voor beoordelaars die relatieve vergelijkingen gebruikt voor nauwkeurigere beloningssignalen. Het team bevroor ook de router om trainingsdrift te beperken en bouwde een verdediging tegen reward hacking die beloningsontwerp, adversariële evaluatie, anomaliedetectie en kruisverificatie combineert.
Naast benchmarks benadrukt Xiaomi praktische toepassingen onder wat het "Vibe World" noemt — het uitbreiden van programmeren in natuurlijke taal van software naar interactieve 3D-werelden, game-ontwikkeling, op Blender gebaseerde 3D-modellering, closed-loop besturing van robotarmen, frontend- en presentatieontwerp, en end-to-end video- en muziekproductie. In onderzoeksomgevingen droeg MiMo-V2.6-Pro bij aan computationele screening van nieuwe MOF-materialen voor PFAS-adsorptie en hielp het bij het formaliseren van de stelling van Li–Yorke in Lean 4, met meer dan 6000 regels kernelgeverifieerde code zonder enige Lean-specifieke post-training. Het Lean 4-resultaat illustreert de gestelde focus van de release op verifieerbare taken, waarbij de kernel van de proof assistant — niet een menselijke reviewer — de gegenereerde output bevestigt.
De modellen zijn toegankelijk via het MiMo API Platform, AI Studio, MiMo Desktop en OpenRouter, met prijzen onveranderd ten opzichte van V2.5. Xiaomi maakt bovendien het volledige technische rapport, de trainingsomgevingen en de RL-code open source om reproductie en verder onderzoek mogelijk te maken. Onafhankelijke reproducties van de run van zes dagen en controles door derden van de gerapporteerde scores zijn de directe vervolgstappen om in de gaten te houden nu de release circuleert.
Bron: Metaverse Post