XiaomiのMiMo-V2.6、完全オープンソースとしてエージェント、サイバーセキュリティ、3Dワールドに対応
重要ポイント
- •MiMo-V2.6-ProはArtificial Analysis Intelligence Indexで46.32を記録し、Kimi K3とQwen3.8 Maxを上回るオープンソースモデル首位となりました。
- •シリーズはAPI価格をV25系の水準に維持し、価格を上げずに知能対コストのフロンティアを拡大しています。
- •DeepSWE v1.1ソフトウェアエンジニアリングベンチマークでは、MiMo-V2.6-FlashがMiMo-V2.5-Proの19.0から67.9に跳ね上がり、Proは71.9を記録してDeepSeek V4.1 FlashおよびClaude、GPTの上位モデルには及びませんでした。
- •ライブ配信された強化学習ランは6日未満で完了し、約75万軌道に及び、コストはFlashが約85万ドル、Proが約262万ドルで、ホールドアウトDeepSWEの向上はそれぞれ約17ポイントと14ポイントでした。
- •研究応用では、MiMo-V2.6-Proが6,000行超のカーネル検証済みコードでLean 4におけるLi-Yorke定理の形式化を支援し、PFAS吸着用の新規MOF材料のスクリーニングにも貢献しました。

Xiaomiは、ネイティブオムニモーダルAIモデルの最新世代「MiMo-V2.6」をリリースし、完全にオープンソース化しました。同社はこのリリースを、検証可能で複雑なタスクにおける強化学習(RL)のスケーリングに向けた重要な一歩として位置づけています。ラインアップは、2つの主力モデル — 同社が史上最強と説明するMiMo-V2.6-Proと、より費用対効果の高いMiMo-V2.6-Flash — に、出力速度が最大20倍のPro-UltraSpeed版を加えた構成です。
Artificial Analysis Intelligence Index(v4.3、2026年9月)で、MiMo-V2.6-Proは46.32を記録し、Kimi K3とQwen3.8 Maxを追い抜いてオープンソースモデルとして最高評価を獲得しました。このシリーズはV2.5のAPI価格を維持しており、コストを上げずに知能対コストのパレートフロンティアを外側へ押し広げています。これは、オープンとクローズドのフロンティアモデルが同じ公開ベンチマークで評価され、オープンソース層がクローズドシステムと同一条件で直接比較される、より大きな流れの一部です。
各モデルは各分野のベンチマークで競争力のある績を示しています。長期的なソフトウェアエンジニアリングテストであるDeepSWE v1.1では、MiMo-V2.6-Proが71.9を記録 — DeepSeek V4.1 Flash(74.2)、Claude Opus 5およびGPT 6 Astra(いずれも74.0)には及ばなかったものの — MiMo-V2.6-Flashは67.9に達し、MiMo-V2.5-Proの19.0から大幅に跳ね上がりました。一般的なエージェントワークフローでは、DeepSeek V4.1 Flashを唯一の例外として、フロンティアモデルの中でAutomation Bench v1.0.6をリードし、サイバー特化のCyberGymベンチマークでは94.0と95.1を記録しました。
Introducing Xiaomi MiMo-V2.6 — Pro & Flash. Frontier intelligence, all the modalities, built in public. Two omnimodal models, advancing through scaled reinforcement learning Pro performs on par with Claude Opus 5 and GPT-5.6 Sol across most agent benchmarks Pro scores… pic.twitter.com/oqfYPC00uK
— Xiaomi MiMo (@XiaomiMiMo) September 21, 2026
公開配信された大規模強化学習
今回のリリースの技術的な柱は、Xiaomiがライブ配信した大規模RL学習ランです。6日未満で、各モデルは約75万軌道にわたる30回のRLステップを完了し、コストはFlashで約85万ドル、Proで約262万ドルでした。学習タスクの平均合格率は相対的にそれぞれ25%と12%上昇し、ホールドアウトベンチマークでの向上も顕著でした。DeepSWE v1.1のスコアは、Flashで約17ポイント(48.8から65.68)、Proで14ポイント(58.4から72.57)上昇しています。同社によると、RLプロセスはサンプル効率が高く、学習分布を超えた汎化を示したといいます。
スケーリングは3つの軸で追求されました。完全非同期アーキテクチャでの更大きなバッチ(1更新あたり1,568サンプル、最大100万トークンのコンテキスト長、1ステップあたり35億〜37億トークン)。コーディング、汎用エージェント、ビジュアル、サイバー領域を網羅するマルチタスクスイート。そして相対比較を用いてより精密な報酬信号を生成する、評価器コンピュートの増強です。チームはさらに、学習ドリフトを抑えるためにルーターを固定し、報酬設計、敵対的評価、異常検知、クロス検証を組み合わせた報酬ハッキング対策も構築しました。
ベンチマークを超えて、Xiaomiは「Vibe World」と呼ぶ応用能力を紹介しています。自然言語プログラミングをソフトウェアからインタラクティブな3Dワールド、ゲーム開発、Blenderベースの3Dモデリング、閉ループのロボットアーム制御、フロントエンドとプレゼンテーションデザイン、そしてエンドツーエンドの動画・音楽制作へと拡張するものです。研究用途では、MiMo-V2.6-ProがPFAS吸着用の新規MOF材料の計算スクリーニングに貢献し、 4でのLi–Yorke定理の形式化を支援して、Lean固有の追加学習なしに6,000行超のカーネル検証済みコードを生成しました。このLean 4の結果は、リリースが掲げる検証可能なタスクへの注力を示すものであり、生成された出力を確認したのは proof assistant のカーネルであり、人間のレビュアーではありません。
モデルはMiMo API Platform、AI Studio、MiMo Desktop、OpenRouterから利用でき、価格はV2.5から変更ありません。Xiaomiはまた、再現とさらなる研究を可能にするため、完全な技術レポート、学習環境、RLコードをオープンソース化しています。6日間のランの第三者による再現と、報告されたスコアの第三者検証が、リリースが広まる中で最初に注目すべきフォローアップです。