Microsoft заявила, что MDASH обошла Claude Mythos и GPT-5.6 Sol в бенчмарке по кибербезопасности
Ключевые выводы
- •Microsoft заявила, что MDASH с MAI-Cyber-1-Flash набрала 95.95% в CyberGym, который проверяет, могут ли ИИ-агенты воспроизводить известные уязвимости.
- •Согласно приведенным оценкам бенчмарка, заявленный результат поставил систему Microsoft выше GPT-5.5 Cyber, Mythos 5, GPT-5.6 Sol и Gemini 3.5 Flash Cyber.
- •MAI-Cyber-1-Flash обрабатывает до 90% задач в MDASH, тогда как самые сложные 10% направляются в GPT-5.4.
- •MDASH использует более 100 специализированных агентов для анализа кода, оценки находок и создания демонстраций proof of concept.
- •Microsoft делает MDASH доступной в закрытом предварительном тестировании через портал Defender; сейчас действуют ограничения на размер репозитория и число параллельных сканирований.

Microsoft представила MAI-Cyber-1-Flash, свою первую специализированную модель для кибербезопасности, и интегрировала ее в MDASH — систему поиска уязвимостей, которая, по заявлению компании, превзошла Anthropic Mythos 5 и OpenAI GPT-5.6 Sol, одновременно снизив затраты на 50% по сравнению с текущей лучшей конфигурацией MDASH от Microsoft.
По данным Microsoft, объединенная конфигурация MDASH набрала 95.95% в CyberGym — бенчмарке, в котором ИИ-агентам предлагается воспроизвести 1,507 известных уязвимостей в 188 open-source проектах. CyberGym оценивает системы по доле уязвимостей, которые им удается успешно воспроизвести в контролируемой среде.
Microsoft заявила, что этот результат вывел MDASH вперед относительно GPT-5.5 Cyber с 85.6%, Mythos 5 с 83.8%, GPT-5.6 Sol с 83.6% и Gemini 3.5 Flash Cyber с 83.2%. Оценка была опубликована самой Microsoft и на момент публикации не появилась в публичной таблице лидеров CyberGym, хотя бенчмарк использует публичный тестовый набор и определенную метрику успеха.
Такие бенчмарки, как CyberGym, важны потому, что проверяют, способен ли агент выйти за рамки простого обнаружения подозрительного кода и действительно воспроизвести известный дефект. Это по-прежнему более узкая задача, чем доказательство того, как система будет работать с частными кодовыми базами, но она дает исследователям и командам безопасности общий способ сравнивать системы поиска уязвимостей.
MAI-Cyber-1-Flash не работает внутри системы самостоятельно. Microsoft сообщила, что модель обрабатывает до 90% задач, тогда как MDASH направляет самые сложные 10% в GPT-5.4. Такая маршрутизация важна, поскольку токены — фрагменты текста, которые обрабатывает ИИ-модель, — создают затраты каждый раз, когда модель читает код или генерирует ответ.
Microsoft описала релиз как первый случай, когда одна из ее моделей, ориентированных на эффективность, смогла превзойти плотную современную модель, разработанную с расчетом на более широкие общие возможности. «В сочетании с MDASH (MAI-Cyber-1-Flash) обеспечивает производительность мирового уровня за 50 процентов стоимости ведущих моделей», — написал генеральный директор Microsoft Satya Nadella.
Today, we are announcing a series of updates that give customers frontier-grade security at half the cost. MAI-Cyber-1-Flash is our first cybersecurity model, built ground up to find the most challenging vulnerabilities in complex code bases. When combined with MDASH, it… pic.twitter.com/npcIihN1H7 — Satya Nadella (@satyanadella) July 27, 2026
Модель, в данном случае MAI-Cyber-1-Flash, — это ИИ-система, которая анализирует код. Обвязка, в данном случае MDASH, — это окружающий ее механизм: агенты, инструменты, проверки и рабочий процесс, которые решают, где искать, оспаривают предполагаемые находки, удаляют дубликаты и доказывают, что ошибку можно вызвать.
MDASH использует более 100 специализированных агентов, которым поручено аудировать код, обсуждать, является ли находка подлинной, и создавать proof of concept — рабочую демонстрацию того, что уязвимость существует. Этот этап proof of concept имеет ключевое значение для команд разработки, поскольку непроверенные отчеты об ошибках могут создавать дополнительную нагрузку на сортировку, тогда как воспроизводимые находки легче приоритизировать и исправлять.
Microsoft заявила, что эпизодические сканирования и отложенные патчи становятся устаревшими по мере того, как ИИ удешевляет поиск ошибок. Компания также утверждает, что десятилетия данных о безопасности дают ей преимущество, заявив: «Никто не может изготовить такую историю».
С момента выхода Claude Mythos специалисты по кибербезопасности пытались сравняться с его возможностями или превзойти их. Исследователи воспроизвели поиск уязвимостей в стиле Mythos с помощью публичных моделей менее чем за $30 за сканирование. Dawid Moczadło, один из участвовавших исследователей, сказал, что «ров смещается от доступа к модели к валидации».
Это означает, что дефицитной частью процесса все чаще становится система, способная доказывать находки, не перегружая разработчиков ложными срабатываниями.
Ранее Decrypt сообщал, что GPT-5.5 Cyber недавно заняла первое место в публичном CyberGym с результатом 85.6%, незначительно опередив Mythos. Новый результат Microsoft примерно на 10 пунктов выше, чем у GPT-5.5 Cyber, и на 7.5 пункта выше предыдущего результата MDASH, но он оценивает всю систему, а не MAI-Cyber-1-Flash отдельно.
Microsoft переводит MDASH в закрытое предварительное тестирование через Microsoft Security Exposure Management на портале Defender. Клиенты могут сканировать Git-репозитории, просматривать находки, ранжированные от маловероятных до доказанных, и использовать Defender CLI для генерации предлагаемых исправлений кода для проверки разработчиками.
В настоящее время предварительная версия ограничивает репозитории примерно 256MB и допускает одно параллельное сканирование на tenant. Ожидается, что Project Perception распространит тот же многоагентный подход за пределы сканирования кода — на более широкие рабочие процессы мониторинга угроз и устранения последствий.