微软称 MDASH 在网络安全基准测试中超过 Claude Mythos 和 GPT-5.6 Sol
要点速览
- •微软称,搭载 MAI-Cyber-1-Flash 的 MDASH 在 CyberGym 上得分 95.95%;该基准测试 AI 代理能否复现已知漏洞。
- •根据所引用的基准分数,微软报告的结果使其系统领先于 GPT-5.5 Cyber、Mythos 5、GPT-5.6 Sol 和 Gemini 3.5 Flash Cyber。
- •MAI-Cyber-1-Flash 在 MDASH 中最多处理 90% 的任务,而最困难的 10% 会被路由至 GPT-5.4。
- •MDASH 使用 100 多个专门代理来审查代码、评估发现并构建概念验证演示。
- •微软正通过 Defender 门户以私有预览形式提供 MDASH,目前设有仓库大小和并发扫描限制。

微软推出了 MAI-Cyber-1-Flash,这是其首个专门用于网络安全的模型,并将其整合进 MDASH。MDASH 是一个漏洞搜寻系统,微软称该系统的表现超过了 Anthropic 的 Mythos 5 和 OpenAI 的 GPT-5.6 Sol,同时与微软当前最佳 MDASH 配置相比将成本降低了 50%。
据微软称,组合后的 MDASH 配置在 CyberGym 上取得了 95.95% 的得分。CyberGym 是一项基准测试,要求 AI 代理在 188 个开源项目中复现 1,507 个已知漏洞。CyberGym 根据系统在受控环境中成功复现漏洞的比例进行评分。
微软表示,这一结果使 MDASH 领先于得分 85.6% 的 GPT-5.5 Cyber、83.8% 的 Mythos 5、83.6% 的 GPT-5.6 Sol,以及 83.2% 的 Gemini 3.5 Flash Cyber。该分数由微软自行报告,截至发稿时尚未出现在 CyberGym 的公开排行榜上,不过该基准使用公开测试集,并有明确的成功指标。
CyberGym 这类基准测试的重要性在于,它们检验代理能否超越标记可疑代码的层面,真正复现一个已知缺陷。这仍然比证明系统在私有代码库中的表现范围更窄,但它为研究人员和安全团队提供了一种比较漏洞搜寻系统的共同方式。
MAI-Cyber-1-Flash 并不是在该系统中独立运行。微软表示,该模型最多处理 90% 的任务,而 MDASH 会将最困难的 10% 路由给 GPT-5.4。这种路由很重要,因为 token——即 AI 模型处理的文本片段——在模型每次读取代码或生成答案时都会产生成本。
微软将此次发布描述为其以效率为重点的模型首次能够击败一个面向更广泛通用能力设计的密集型、最先进模型。微软首席执行官 Satya Nadella 写道:“When combined with MDASH, (MAI-Cyber-1-Flash) delivers world-class performance at 50 percent of the cost of leading models,”
Today, we are announcing a series of updates that give customers frontier-grade security at half the cost. MAI-Cyber-1-Flash is our first cybersecurity model, built ground up to find the most challenging vulnerabilities in complex code bases. When combined with MDASH, it… pic.twitter.com/npcIihN1H7 — Satya Nadella (@satyanadella) July 27, 2026
模型,在这里指 MAI-Cyber-1-Flash,是对代码进行推理的 AI 系统。框架,在这里指 MDASH,则是其周围的机制:包括代理、工具、检查和工作流,用于决定查看哪里、质疑可疑发现、去除重复项,并证明某个漏洞可以被触发。
MDASH 使用 100 多个专门代理来审计代码、讨论某项发现是否真实,并构建概念验证——即证明该缺陷存在的可运行演示。对于软件团队而言,这一概念验证步骤至关重要,因为未经验证的漏洞报告可能带来额外的分诊工作,而可复现的发现更容易被排序和修复。
微软表示,随着 AI 让漏洞发现成本降低,偶发式扫描和延迟修补正变得过时。该公司还称,其数十年的安全数据赋予其优势,并表示:“No one can manufacture this history.”
自 Claude Mythos 发布以来,网络安全专家一直在尝试匹配或超越其能力。研究人员使用公开模型复现了 Mythos 风格的漏洞搜寻,每次扫描成本低于 30 美元。参与研究的 Dawid Moczadło 表示,“the moat is moving from model access to validation.”
这意味着,流程中越来越稀缺的部分,是能够在不让开发者被误报淹没的情况下证明发现的系统。
Decrypt 此前报道称,GPT-5.5 Cyber 最近以 85.6% 的得分登上 CyberGym 公开排行榜首位,略微超过 Mythos。微软新报告的分数比 GPT-5.5 Cyber 高约 10 个百分点,比 MDASH 之前的结果高 7.5 个百分点,但它评估的是完整系统,而不是单独的 MAI-Cyber-1-Flash。
微软正通过 Defender 门户中的 Microsoft Security Exposure Management 将 MDASH 纳入私有预览。客户可以扫描 Git 仓库,查看从“不太可能”到“已证明”排序的发现,并使用 Defender CLI 生成拟议的代码修复方案,供开发者审查。
该预览目前将仓库大小限制在约 256MB,并允许每个租户同时进行一次扫描。Project Perception 预计将把同样的多代理方法从代码扫描扩展到更广泛的威胁监控和修复工作流。