НовостиАкцииMiMo-V2.6 от Xiaomi нацелен на агентов, кибербезопасность и 3D-миры в полностью открытом релизе

MiMo-V2.6 от Xiaomi нацелен на агентов, кибербезопасность и 3D-миры в полностью открытом релизе

Автор: Metaverse Post·

Ключевые выводы

  • •MiMo-V2.6-Pro заняла первое место среди моделей с открытым исходным кодом в Artificial Analysis Intelligence Index, набрав 46.32 балла и обойдя Kimi K3 и Qwen3.8 Max.
  • •Цены на API серии сохранены на уровне предшественницы V2.5, что расширяет границу соотношения интеллекта и стоимости без повышения цен.
  • •В бенчмарке DeepSWE v1.1 для разработки программного обеспечения MiMo-V2.6-Flash выросла до 67.9 балла против 19.0 у MiMo-V2.5-Pro, тогда как Pro набрала 71.9 и уступила DeepSeek V4.1 Flash, а также лидирующим моделям Claude и GPT.
  • •Транслировавшийся в прямом эфире запуск обучения с подкреплением завершился менее чем за шесть дней и охватил около 750,000 траекторий при затратах примерно $0.85 million для Flash и $2.62 million для Pro; результаты DeepSWE на отложенных данных выросли примерно на 17 и 14 пунктов соответственно.
  • •В исследовательских задачах MiMo-V2.6-Pro помогла формализовать теорему Ли — Йорка в Lean 4, создав более 6,000 строк кода, проверенного ядром, а также участвовала в скрининге новых MOF-материалов для адсорбции PFAS.
MiMo-V2.6 от Xiaomi нацелен на агентов, кибербезопасность и 3D-миры в полностью открытом релизе

Xiaomi выпустила и полностью открыла исходный код MiMo-V2.6 — новейшего поколения своих нативно омнимодальных ИИ-моделей, представив запуск как важный шаг к масштабированию обучения с подкреплением (RL) на проверяемых и сложных задачах. Линейка включает две основные модели — MiMo-V2.6-Pro, которую компания называет своей наиболее производительной моделью на сегодняшний день, и более экономичную MiMo-V2.6-Flash, — а также вариант Pro-UltraSpeed, обеспечивающий скорость генерации до 20 раз выше.

В Artificial Analysis Intelligence Index (v4.3, September 2026) MiMo-V2.6-Pro набрала 46.32 балла, обойдя Kimi K3 и Qwen3.8 Max и заняв первое место среди моделей с открытым исходным кодом. Серия также сохраняет цены на API на уровне предшественницы V2.5, расширяя границу Парето соотношения интеллекта и стоимости без изменения цены. Это соответствует более широкой тенденции, при которой открытые и закрытые передовые модели оцениваются на одних и тех же публичных бенчмарках, что позволяет напрямую сопоставлять модели с открытым исходным кодом и закрытые системы.

Модели показывают конкурентоспособные результаты в различных дисциплинах. В DeepSWE v1.1 — тесте долгосрочной разработки программного обеспечения — MiMo-V2.6-Pro набрала 71.9 балла, уступив DeepSeek V4.1 Flash (74.2), а также Claude Opus 5 и GPT 6 Astra (по 74.0), тогда как MiMo-V2.6-Flash достигла 67.9 балла, резко улучшив результат MiMo-V2.5-Pro, составлявший 19.0. В общих агентных рабочих процессах серия возглавила Automation Bench v1.0.6 среди передовых моделей, за исключением DeepSeek V4.1 Flash, а в ориентированном на кибербезопасность бенчмарке CyberGym получила 94.0 и 95.1 балла.

Introducing Xiaomi MiMo-V2.6 — Pro \u0026 Flash. Frontier intelligence, all the modalities, built in public. Two omnimodal models, advancing through scaled reinforcement learning Pro performs on par with Claude Opus 5 and GPT-5.6 Sol across most agent benchmarks Pro scores… pic.twitter.com/oqfYPC00uK

— Xiaomi MiMo (@XiaomiMiMo) September 21, 2026

Масштабное обучение с подкреплением в прямом эфире

Технической основой релиза стал масштабный запуск обучения с подкреплением, который Xiaomi транслировала в прямом эфире. Менее чем за шесть дней каждая модель прошла 30 шагов RL примерно на 750,000 траекториях при затратах около $0.85 million для Flash и $2.62 million для Pro. Средние показатели прохождения обучающих задач выросли соответственно на 25% и 12% в относительном выражении, а результаты на отложенных бенчмарках существенно улучшились: показатели DeepSWE v1.1 выросли примерно на 17 пунктов для Flash (с 48.8 до 65.68) и на 14 пунктов для Pro (с 58.4 до 72.57). По данным компании, процесс RL оказался эффективным с точки зрения использования выборки и обобщался за пределами обучающего распределения.

Масштабирование проводилось по трем направлениям: увеличение размеров пакетов в полностью асинхронной архитектуре (1,568 образцов на обновление, длина контекста до 1 million и 3.5–3.7 billion токенов на шаг); многозадачный набор, охватывающий программирование, общих агентов, визуальные и кибербезопасностные задачи; а также увеличение вычислительных ресурсов для оценивания с использованием относительных сравнений для формирования более точных сигналов вознаграждения. Команда также зафиксировала маршрутизатор, чтобы ограничить дрейф в процессе обучения, и внедрила защиту от взлома функции вознаграждения, объединив проектирование вознаграждений, состязательное оценивание, обнаружение аномалий и перекрестную проверку.

Помимо бенчмарков, Xiaomi демонстрирует прикладные возможности в рамках концепции, которую называет «Vibe World»: расширение программирования на естественном языке от программного обеспечения до интерактивных 3D-миров, разработки игр, 3D-моделирования на базе Blender, управления роботизированной рукой в замкнутом контуре, дизайна интерфейсов и презентаций, а также полного цикла производства видео и музыки. В исследовательских задачах MiMo-V2.6-Pro участвовала в вычислительном скрининге новых MOF-материалов для адсорбции PFAS и помогала формализовать теорему Ли — Йорка в Lean 4, создав более 6,000 строк кода, проверенного ядром, без специального дообучения для Lean. Результат в Lean 4 отражает заявленный фокус релиза на проверяемых задачах: сгенерированный результат подтверждало ядро системы автоматизированного доказательства, а не человек-рецензент.

Доступ к моделям можно получить через MiMo API Platform, AI Studio, MiMo Desktop и OpenRouter; цены остаются неизменными по сравнению с V2.5. Xiaomi также открывает исходный код полного технического отчета, сред обучения и кода RL для воспроизведения и дальнейших исследований. По мере распространения релиза основными ближайшими направлениями для проверки станут независимое воспроизведение шестидневного запуска и сторонняя проверка заявленных показателей.

Источник: Metaverse Post