新聞股票Microsoft 稱 MDASH 在網路安全基準測試中超越 Claude Mythos 與 GPT-5.6 Sol

Microsoft 稱 MDASH 在網路安全基準測試中超越 Claude Mythos 與 GPT-5.6 Sol

作者: Decrypt·

重點速覽

  • Microsoft 表示,搭載 MAI-Cyber-1-Flash 的 MDASH 在 CyberGym 上取得 95.95% 的分數;CyberGym 測試 AI 代理是否能重現已知漏洞。
  • Microsoft 公布的結果顯示,其系統在所引用的基準測試分數上領先 GPT-5.5 Cyber、Mythos 5、GPT-5.6 Sol 和 Gemini 3.5 Flash Cyber。
  • MAI-Cyber-1-Flash 在 MDASH 中處理最多 90% 的任務,最困難的 10% 則轉交給 GPT-5.4。
  • MDASH 使用超過 100 個專門代理來審查程式碼、評估發現結果並建立概念驗證示範。
  • Microsoft 正透過 Defender 入口網站以私人預覽形式提供 MDASH,目前仍設有儲存庫大小與並行掃描限制。
Microsoft 稱 MDASH 在網路安全基準測試中超越 Claude Mythos 與 GPT-5.6 Sol

Microsoft 推出 MAI-Cyber-1-Flash,這是其首個專門用於網路安全的模型,並將其整合至 MDASH。MDASH 是一套漏洞搜尋系統,Microsoft 稱其表現優於 Anthropic 的 Mythos 5 和 OpenAI 的 GPT-5.6 Sol,同時成本較 Microsoft 目前最佳的 MDASH 配置降低 50%。

根據 Microsoft 說法,整合後的 MDASH 配置在 CyberGym 上取得 95.95% 的分數。CyberGym 是一項基準測試,要求 AI 代理在 188 個開源專案中重現 1,507 個已知漏洞,並依系統在受控環境中成功重現漏洞的比例評分。

Microsoft 表示,該結果讓 MDASH 領先 GPT-5.5 Cyber 的 85.6%、Mythos 5 的 83.8%、GPT-5.6 Sol 的 83.6%,以及 Gemini 3.5 Flash Cyber 的 83.2%。該分數由 Microsoft 自行公布,發稿時尚未出現在 CyberGym 的公開排行榜上,不過該基準測試使用公開測試集和明確定義的成功指標。

CyberGym 這類基準測試的重要性在於,它們測試代理是否能不只標記可疑程式碼,還能實際重現已知缺陷。這仍比證明系統在私有程式碼庫中的表現更為狹窄,但它為研究人員和安全團隊提供了比較漏洞搜尋系統的共同方式。

MAI-Cyber-1-Flash 並非在系統中單獨運作。Microsoft 表示,該模型可處理最多 90% 的任務,而 MDASH 會將最困難的 10% 轉交給 GPT-5.4。這種路由安排之所以重要,是因為 token——AI 模型處理的文字片段——在模型每次讀取程式碼或產生答案時都會產生成本。

Microsoft 將這次發布描述為其以效率為重點的模型首次能夠擊敗為更廣泛通用能力而設計的密集型頂尖模型。Microsoft 執行長 Satya Nadella 寫道:「與 MDASH 結合時,(MAI-Cyber-1-Flash)能以領先模型 50% 的成本提供世界級效能。」

Today, we are announcing a series of updates that give customers frontier-grade security at half the cost. MAI-Cyber-1-Flash is our first cybersecurity model, built ground up to find the most challenging vulnerabilities in complex code bases. When combined with MDASH, it… pic.twitter.com/npcIihN1H7 — Satya Nadella (@satyanadella) July 27, 2026

模型,在此案例中是 MAI-Cyber-1-Flash,是對程式碼進行推理的 AI 系統。框架,在此案例中是 MDASH,則是其周邊機制:包括代理、工具、檢查與工作流程,用來決定要查看何處、質疑疑似發現、移除重複項目,並證明某個錯誤可以被觸發。

MDASH 使用超過 100 個專門代理,負責稽核程式碼、討論某項發現是否屬實,並建立概念驗證——也就是證明該缺陷確實存在的可運作示範。概念驗證這一步對軟體團隊至關重要,因為未經驗證的錯誤報告可能增加額外的分類處理工作,而可重現的發現更容易排定優先順序並修復。

Microsoft 表示,隨著 AI 讓漏洞發現成本下降,偶爾掃描和延遲修補正在變得過時。該公司也主張,其數十年的安全資料帶來優勢,並表示:「沒有人能製造出這段歷史。」

自 Claude Mythos 發布以來,網路安全專家一直試圖追平或超越其能力。研究人員使用公開模型,以每次掃描低於 30 美元的成本重現了 Mythos 風格的漏洞搜尋。參與研究的 Dawid Moczadło 表示:「護城河正從模型存取轉向驗證。」

這意味著,流程中越來越稀缺的部分,是能夠證明發現結果、同時不讓開發者被誤報淹沒的系統。

Decrypt 先前曾報導,GPT-5.5 Cyber 最近以 85.6% 的分數登上 CyberGym 公開排行榜首位,略微領先 Mythos。Microsoft 新公布的分數比 GPT-5.5 Cyber 高約 10 個百分點,並比 MDASH 先前結果高 7.5 個百分點,但該評估對象是完整系統,而非單獨的 MAI-Cyber-1-Flash。

Microsoft 正透過 Defender 入口網站中的 Microsoft Security Exposure Management,將 MDASH 推入私人預覽。客戶可以掃描 Git 儲存庫,查看從不太可能到已證實分級的發現結果,並使用 Defender CLI 產生建議的程式碼修復方案,供開發者審查。

目前預覽版將儲存庫限制在約 256MB,且每個租戶允許一次並行掃描。Project Perception 預計會將相同的多代理方法從程式碼掃描延伸到更廣泛的威脅監控與補救工作流程。