NachrichtenAktienXiaomis MiMo-V2.6 zielt auf Agenten, Cybersicherheit und 3D-Welten in vollständig quelloffener Veröffentlichung

Xiaomis MiMo-V2.6 zielt auf Agenten, Cybersicherheit und 3D-Welten in vollständig quelloffener Veröffentlichung

Autor: Metaverse Post·

Wichtige Erkenntnisse

  • •MiMo-V2.6-Pro erreichte mit 46.32 Punkten die höchste Bewertung unter den Open-Source-Modellen im Artificial Analysis Intelligence Index und übertraf Kimi K3 sowie Qwen3.8 Max.
  • •Die Reihe behält die API-Preise des Vorgängers V2.5 bei und erweitert damit die Intelligenz-Kosten-Grenze ohne Preiserhöhung.
  • •Im Softwareentwicklungsbenchmark DeepSWE v1.1 stieg MiMo-V2.6-Flash von 19.0 bei MiMo-V2.5-Pro auf 67.9 Punkte, während Pro 71.9 Punkte erzielte und damit hinter DeepSeek V4.1 Flash sowie den führenden Claude- und GPT-Modellen lag.
  • •Der live übertragene Reinforcement-Learning-Lauf wurde in weniger als sechs Tagen mit rund 750,000 Trajektorien abgeschlossen und kostete etwa $0.85 million für Flash sowie $2.62 million für Pro. Bei DeepSWE wurden in zurückgehaltenen Tests Verbesserungen von rund 17 beziehungsweise 14 Punkten erzielt.
  • •In Forschungsanwendungen half MiMo-V2.6-Pro bei der Formalisierung des Li-Yorke-Theorems in Lean 4 mit mehr als 6,000 Zeilen kernelverifizierten Codes und beim Screening neuartiger MOF-Materialien für die PFAS-Adsorption.
Xiaomis MiMo-V2.6 zielt auf Agenten, Cybersicherheit und 3D-Welten in vollständig quelloffener Veröffentlichung

Xiaomi hat MiMo-V2.6 vollständig als Open Source veröffentlicht, die neueste Generation seiner nativ omnimodalen KI-Modelle. Das Unternehmen stellt die Veröffentlichung als wichtigen Schritt zur Skalierung von Reinforcement Learning (RL) für verifizierbare, komplexe Aufgaben dar. Die Produktreihe umfasst zwei Kernmodelle — MiMo-V2.6-Pro, das Xiaomi als sein bislang leistungsfähigstes Modell beschreibt, und das kostengünstigere MiMo-V2.6-Flash — sowie eine Pro-UltraSpeed-Variante, die Ausgabegeschwindigkeiten von bis zu 20-mal höher bietet.

Im Artificial Analysis Intelligence Index (v4.3, September 2026) erzielte MiMo-V2.6-Pro einen Wert von 46.32 und überholte Kimi K3 sowie Qwen3.8 Max. Damit erreichte das Modell die höchste Bewertung unter den Open-Source-Modellen. Die Reihe behält außerdem die API-Preise ihres Vorgängers V2.5 bei und verschiebt die Pareto-Grenze zwischen Intelligenz und Kosten bei unveränderten Preisen nach außen. Dies steht im Zusammenhang mit einem breiteren Trend, bei dem offene und geschlossene Frontier-Modelle anhand derselben öffentlichen Benchmarks bewertet werden. Dadurch bleibt die Open-Source-Klasse im direkten Vergleich mit geschlossenen Systemen.

Die Modelle schneiden in verschiedenen Disziplinen wettbewerbsfähig ab. Im Langzeittest DeepSWE v1.1 für Softwareentwicklung erzielte MiMo-V2.6-Pro 71.9 Punkte — hinter DeepSeek V4.1 Flash (74.2) sowie Claude Opus 5 und GPT 6 Astra (jeweils 74.0) — während MiMo-V2.6-Flash 67.9 Punkte erreichte und sich damit gegenüber den 19.0 Punkten von MiMo-V2.5-Pro deutlich verbesserte. Bei allgemeinen agentischen Arbeitsabläufen führte die Reihe im Automation Bench v1.0.6 unter den Frontier-Modellen, mit der alleinigen Ausnahme von DeepSeek V4.1 Flash. Im auf Cybersicherheit ausgerichteten CyberGym-Benchmark erzielte sie Werte von 94.0 und 95.1.

Introducing Xiaomi MiMo-V2.6 — Pro & Flash. Frontier intelligence, all the modalities, built in public. Two omnimodal models, advancing through scaled reinforcement learning Pro performs on par with Claude Opus 5 and GPT-5.6 Sol across most agent benchmarks Pro scores… pic.twitter.com/oqfYPC00uK

— Xiaomi MiMo (@XiaomiMiMo) September 21, 2026

Reinforcement Learning in großem Maßstab, öffentlich übertragen

Das technische Fundament der Veröffentlichung bildet ein groß angelegter RL-Trainingslauf, den Xiaomi live übertrug. In weniger als sechs Tagen absolvierte jedes Modell 30 RL-Schritte über rund 750,000 Trajektorien. Die Kosten beliefen sich auf ungefähr $0.85 million für Flash und $2.62 million für Pro. Die durchschnittlichen Erfolgsquoten bei den Trainingsaufgaben stiegen relativ um 25% beziehungsweise 12%. Auch die Verbesserungen bei den zurückgehaltenen Benchmarks waren erheblich: Die DeepSWE-v1.1-Werte stiegen bei Flash um rund 17 Punkte (48.8 auf 65.68) und bei Pro um 14 Punkte (58.4 auf 72.57). Nach Angaben des Unternehmens erwies sich der RL-Prozess als stichprobeneffizient und generalisierte über die Trainingsverteilung hinaus.

Die Skalierungsbemühungen konzentrierten sich auf drei Bereiche: größere Batches auf einer vollständig asynchronen Architektur (1,568 Samples pro Aktualisierung, Kontextlängen von bis zu 1 million und 3.5–3.7 billion tokens pro Schritt); eine Multi-Task-Suite für Programmierung, allgemeine Agenten sowie visuelle und Cybersecurity-Domänen; und mehr Rechenleistung für die Bewertung, wobei relative Vergleiche präzisere Belohnungssignale liefern. Das Team fror außerdem den Router ein, um Trainingsdrift einzudämmen, und entwickelte eine Abwehr gegen Reward Hacking, die Reward-Design, adversariale Evaluierung, Anomalieerkennung und Gegenprüfung kombiniert.

Über die Benchmarks hinaus stellt Xiaomi praktische Fähigkeiten unter dem Begriff „Vibe World“ vor. Dazu gehört die Erweiterung natürlichsprachlicher Programmierung von Software auf interaktive 3D-Welten, Spieleentwicklung, 3D-Modellierung mit Blender, die Regelung von Roboterarmen im geschlossenen Regelkreis, Frontend- und Präsentationsdesign sowie die durchgängige Produktion von Videos und Musik. In Forschungsszenarien trug MiMo-V2.6-Pro zum computergestützten Screening neuartiger MOF-Materialien für die PFAS-Adsorption bei und half bei der Formalisierung des Li–Yorke-Theorems in Lean 4. Dabei entstanden mehr als 6,000 Zeilen kernelverifizierten Codes ohne Lean-spezifisches Post-Training. Das Ergebnis mit Lean 4 verdeutlicht den erklärten Schwerpunkt der Veröffentlichung auf verifizierbaren Aufgaben: Der Kernel des Beweisassistenten — nicht ein menschlicher Prüfer — bestätigte die generierte Ausgabe.

Die Modelle sind über die MiMo API Platform, AI Studio, MiMo Desktop und OpenRouter verfügbar. Die Preise bleiben gegenüber V2.5 unverändert. Xiaomi stellt außerdem den vollständigen technischen Bericht, die Trainingsumgebungen und den RL-Code als Open Source bereit, um Reproduktionen und weitere Forschung zu ermöglichen. Unabhängige Reproduktionen des sechstägigen Trainingslaufs und Prüfungen der gemeldeten Werte durch Dritte sind die unmittelbaren nächsten Schritte, die nach der Veröffentlichung zu beobachten sind.

Quelle: Metaverse Post