新闻股票小米 MiMo-V2.6 全面开源发布:聚焦智能体、网络安全与 3D 世界

小米 MiMo-V2.6 全面开源发布:聚焦智能体、网络安全与 3D 世界

作者: Metaverse Post·

要点速览

  • •MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index 上以 46.32 分位居开源模型评分之首,超越 Kimi K3 和 Qwen3.8 Max。
  • •该系列的 API 定价维持在 V2.5 前代的水平,在不涨价的情况下扩展了智能与成本的前沿。
  • •在 DeepSWE v1.1 软件工程基准上,MiMo-V2.6-Flash 从 MiMo-V2.5-Pro 的 19.0 跃升至 67.9,Pro 得分 71.9,落后于 DeepSeek V4.1 Flash 以及 Claude 和 GPT 的领先者。
  • •全程直播的强化学习训练在不到六天内完成,覆盖约 75 万条轨迹,成本约为 Flash 85 万美元、Pro 262 万美元,DeepSWE 保留基准分别提升约 17 分和 14 分。
  • •在研究应用中,MiMo-V2.6-Pro 协助在 Lean 4 中形式化 Li-Yorke 定理,生成超过 6,000 行经内核验证的代码,并参与了用于 PFAS 吸附的新型 MOF 材料筛选。
小米 MiMo-V2.6 全面开源发布:聚焦智能体、网络安全与 3D 世界

小米已发布并全面开源 MiMo-V2.6,这是其原生全模态 AI 模型的最新一代,并将此次发布定位为在可验证的复杂任务上扩展强化学习(RL)的关键一步。该系列包含两款核心模型——被公司称为迄今最强模型的 MiMo-V2.6-Pro,以及更具成本效益的 MiMo-V2.6-Flash——此外还有输出速度最高快 20 倍的 Pro-UltraSpeed 变体。

在 Artificial Analysis Intelligence Index(v4.3,2026 年 9 月)上,MiMo-V2.6-Pro 获得 46.32 分,超越 Kimi K3 和 Qwen3.8 Max,位居开源模型评分之首。该系列同时保留了前代 V2.5 的 API 定价,在成本不变的情况下将智能与成本的帕累托前沿向外推进。这也是开放与闭源前沿模型在相同公开基准上被评分这一更广泛趋势的一部分,使开源层级与闭源系统处于直接、同口径的对比之中。

这些模型在各领域的基准测试中均具竞争力。在长周期软件工程测试 DeepSWE v1.1 上,MiMo-V2.6-Pro 得分 71.9——落后于 DeepSeek V4.1 Flash(74.2)以及 Claude Opus 5 和 GPT 6 Astra(均为 74.0)——而 MiMo-V2.6-Flash 达到 67.9,较 MiMo-V2.5-Pro 的 19.0 大幅跃升。在通用智能体工作流方面,该系列在除 DeepSeek V4.1 Flash 之外的前沿模型中领跑 Automation Bench v1.0.6,并在聚焦网络安全的 CyberGym 基准上分别获得 94.0 和 95.1 的成绩。

Introducing Xiaomi MiMo-V2.6 — Pro & Flash. Frontier intelligence, all the modalities, built in public. Two omnimodal models, advancing through scaled reinforcement learning Pro performs on par with Claude Opus 5 and GPT-5.6 Sol across most agent benchmarks Pro scores… pic.twitter.com/oqfYPC00uK

— Xiaomi MiMo (@XiaomiMiMo) September 21, 2026

大规模强化学习,全程公开直播

本次发布的技术基石是小米全程直播的大规模 RL 训练。在不到六天的时间里,每个模型完成了 30 个 RL 步骤,覆盖约 75 万条轨迹,成本分别约为 85 万美元(Flash)和 262 万美元(Pro)。训练任务的平均通过率相对提升了 25% 和 12%,在保留基准上的提升也十分显著:Flash 的 DeepSWE v1.1 分数提高约 17 分(从 48.8 提升至 65.68),Pro 提高约 14 分(从 58.4 提升至 72.57)。据公司介绍,RL 过程展现出良好的样本效率,泛化到训练分布之外。

扩展沿三个方向推进:在完全异步架构上采用更大批次(每次更新 1,568 个样本,上下文长度最高达 100 万,每步 35 亿至 37 亿 token);涵盖编程、通用智能体、视觉与网络安全领域的多任务套件;以及增加评分器算力,通过相对比较生成更精确的奖励信号。团队还冻结了路由器以抑制训练漂移,并构建了结合奖励设计、对抗评估、异常检测和交叉验证的奖励破解防御机制。

在基准测试之外,小米还展示了其所谓“Vibe World”的应用能力——将自然语言编程从软件延伸到交互式 3D 世界、游戏开发、基于 Blender 的 3D 建模、机械臂闭环控制、前端与演示设计,以及端到端的视频和音乐制作。在研究场景中,MiMo-V2.6-Pro 参与了用于 PFAS 吸附的新型 MOF 材料的计算筛选,并协助在 Lean 4 中形式化 Li–Yorke 定理,生成了超过 6,000 行经内核验证的代码,且无需任何针对 Lean 的后训练。Lean 4 的成果体现了本次发布所强调的对可验证任务的专注:确认生成输出的是证明助手的内核,而非人工审阅者。

这些模型可通过 MiMo API Platform、AI Studio、MiMo Desktop 和 OpenRouter 访问,定价与 V2.5 保持不变。小米还将开源完整的技术报告、训练环境和 RL 代码,以支持复现和进一步研究。随着此次发布的传播,对六天训练的独立复现以及对所报告分数的第三方核验是接下来值得关注的进展。

来源:Metaverse Post