新聞股票小米 MiMo-V2.6 全面開源亮相:進軍智慧代理、資安與 3D 世界

小米 MiMo-V2.6 全面開源亮相:進軍智慧代理、資安與 3D 世界

作者: Metaverse Post·

重點速覽

  • •MiMo-V2.6-Pro 在 Artificial Analysis 智能指數上以 46.32 分登上開源模型評分之首,超越 Kimi K3 與 Qwen3.8 Max。
  • •該系列維持前代 V2.5 的 API 定價水準,在不調漲價格的情況下拓展智能與成本的前沿。
  • •在 DeepSWE v1.1 軟體工程基準上,MiMo-V2.6-Flash 從 MiMo-V2.5-Pro 的 19.0 躍升至 67.9,而 Pro 得分 71.9,落後 DeepSeek V4.1 Flash 及 Claude 與 GPT 領先者。
  • •這場直播強化學習訓練在不到六天內完成,涵蓋約 75 萬條軌,Flash 成本約 85 萬美元、Pro 約 262 萬美元,保留集 DeepSWE 分別提升約 17 分與 14 分。
  • •在研究應用中,MiMo-V2.6-Pro 協助在 Lean 4 中形式化 Li–Yorke 定理,生成超過 6,000 行經核心驗證的程式碼,並參與篩選用於 PFAS 吸附的新型 MOF 材料。
小米 MiMo-V2.6 全面開源亮相:進軍智慧代理、資安與 3D 世界

小米已發布並全面開源 MiMo-V2.6,這是其最新一代原生全模態 AI 模型,並將此次發布定位為在可驗證的複雜任務上擴展強化學習(RL)的關鍵一步。產品線包含兩款核心模型——被公司形容為迄今最強模型的 MiMo-V2.6-Pro,以及更具成本效益的 MiMo-V2.6-Flash——另有一款輸出速度最高快 20 倍的 Pro-UltraSpeed 變體。

在 Artificial Analysis 智能指數(v4.3,2026 年 9 月)上,MiMo-V2.6-Pro 獲得 46.32 分,超越 Kimi K3 與 Qwen3.8 Max,登上開源模型評分之首。此系列同時維持前代 V2.5 的 API 定價,在成本不變的情況下,將智能與成本之間的帕累托前沿向外推進。這也反映出更廣泛的趨勢:開源與閉源前沿模型在同一批公開基準上接受評分,使開源陣營能與閉源系統進行直接的同等比較。

這些模型在各領域的基準測試中表現具競爭力。在長時程軟體工程測試 DeepSWE v1.1 上,MiMo-V2.6-Pro 得分 71.9,落後於 DeepSeek V4.1 Flash(74.2)以及 Claude Opus 5 和 GPT 6 Astra(均為 74.0);MiMo-V2.6-Flash 則達到 67.9,相較 MiMo-V2.5-Pro 的 19.0 有大幅躍升。在通用智慧代理工作流程方面,該系列在 Automation Bench v1.0.6 上領先所有前沿模型,唯一例外是 DeepSeek V4.1 Flash;在聚焦資安的 CyberGym 基準上,則分別錄得 94.0 與 95.1 的成績。

Introducing Xiaomi MiMo-V2.6 — Pro & Flash. Frontier intelligence, all the modalities, built in public. Two omnimodal models, advancing through scaled reinforcement learning Pro performs on par with Claude Opus 5 and GPT-5.6 Sol across most agent benchmarks Pro scores… pic.twitter.com/oqfYPC00uK

— Xiaomi MiMo (@XiaomiMiMo) September 21, 2026

大規模強化學習,公開直播進行

本次發布的技術基礎是一場由小米公開直播的大規模 RL 訓練。在不到六天內,每個模型完成了 30 個 RL 步驟,涵蓋約 75 萬條軌跡,成本約為 Flash 85 萬美元、Pro 26 萬美元。訓練任務的平均通過率分別相對提升 25% 與 12%,而在保留測試集基準上的增益也相當可觀:DeepSWE v1.1 分數 Flash 提升約 17 分(48.8 至 65.68)、Pro 提升約 14 分(58.4 至 72.57)。據公司表示,RL 過程展現了樣本效率,並能泛化至訓練分布之外。

擴展工作沿三個軸線推進:在完全非同步架構上採用更大批量(每次更新 1,568 個樣本、上下文長度最高達 100 萬、每步 35 億至 37 億個 token);涵蓋程式編寫、通用智慧代理、視覺與資安領域的多任務套件;以及增加評分器運算量,利用相對比較產生更精確的獎勵訊號。團隊亦凍結路由器以抑制訓練漂移,並結合獎勵設計、對抗式評估、異常檢測與交叉驗證,建立防範獎勵作弊的機制。

在基準測試之外,小米展示了所謂「Vibe World」下的應用能力——將自然語言編程從軟體延伸至互動式 3D 世界、遊戲開發、基於 Blender 的 3D 建模、閉環機械手臂控制、前端與簡報設計,以及端到端的影片與音樂製作。在研究場景中,MiMo-V2.6-Pro 參與了針對 PFAS 吸附的新型 MOF 材料計算篩選,並協助在 Lean 4 中形式化 Li–Yorke 定理,生成超過 6,000 行經核心驗證的程式碼,且無需任何 Lean 專門的後訓練。Lean 4 的成果體現了此次發布強調的可驗證任務焦點——確認生成輸出的是證明助手的核心,而非人工審查者。

這些模型可透過 MiMo API 平台、AI Studio、MiMo Desktop 與 OpenRouter 取用,定價與 V2.5 相同。小米也將開源完整技術報告、訓練環境與 RL 程式碼,以利復現與進一步研究。隨著此次發布傳播開來,對六天訓練的獨立復現以及第三方對所報分數的查核,是接下來值得關注的後續進展。

來源:Metaverse Post