Microsoft affirme que MDASH devance Claude Mythos et GPT-5.6 Sol dans un benchmark de cybersécurité
Points clés
- •Microsoft a déclaré que MDASH avec MAI-Cyber-1-Flash avait obtenu 95.95% sur CyberGym, qui teste la capacité des agents d’IA à reproduire des vulnérabilités connues.
- •Le résultat déclaré place le système de Microsoft devant GPT-5.5 Cyber, Mythos 5, GPT-5.6 Sol et Gemini 3.5 Flash Cyber selon les scores de benchmark cités.
- •MAI-Cyber-1-Flash traite jusqu’à 90% des tâches dans MDASH, tandis que les 10% les plus difficiles sont acheminées vers GPT-5.4.
- •MDASH utilise plus de 100 agents spécialisés pour examiner le code, évaluer les résultats et créer des démonstrations de preuve de concept.
- •Microsoft rend MDASH disponible en préversion privée via le portail Defender, avec des limites actuelles sur la taille des dépôts et les analyses simultanées.

Microsoft a présenté MAI-Cyber-1-Flash, son premier modèle dédié à la cybersécurité, et l’a intégré à MDASH, un système de recherche de vulnérabilités qui, selon l’entreprise, a surpassé Mythos 5 d’Anthropic et GPT-5.6 Sol d’OpenAI tout en réduisant les coûts de 50% par rapport à la meilleure configuration MDASH actuelle de Microsoft.
Selon Microsoft, la configuration MDASH combinée a obtenu un score de 95.95% sur CyberGym, un benchmark qui demande à des agents d’IA de reproduire 1,507 vulnérabilités connues dans 188 projets open source. CyberGym évalue les systèmes selon le pourcentage de vulnérabilités qu’ils parviennent à reproduire avec succès dans un environnement contrôlé.
Microsoft a déclaré que ce résultat plaçait MDASH devant GPT-5.5 Cyber à 85.6%, Mythos 5 à 83.8%, GPT-5.6 Sol à 83.6% et Gemini 3.5 Flash Cyber à 83.2%. Le score a été autodéclaré par Microsoft et n’apparaissait pas dans le classement public de CyberGym au moment de la publication, bien que le benchmark utilise un jeu de tests public et une métrique de réussite définie.
Les benchmarks comme CyberGym sont importants parce qu’ils vérifient si un agent peut aller au-delà du simple signalement de code suspect et effectivement reproduire une faille connue. Cela reste plus limité que de prouver comment un système se comportera sur des bases de code privées, mais cela donne aux chercheurs et aux équipes de sécurité un moyen commun de comparer les systèmes de recherche de vulnérabilités.
MAI-Cyber-1-Flash ne fonctionne pas seul au sein du système. Microsoft a indiqué que le modèle traite jusqu’à 90% des tâches, tandis que MDASH achemine les 10% les plus difficiles vers GPT-5.4. Ce routage est important, car les tokens — les fragments de texte qu’un modèle d’IA traite — entraînent un coût chaque fois qu’un modèle lit du code ou génère une réponse.
Microsoft a décrit ce lancement comme la première fois que l’un de ses modèles axés sur l’efficacité est capable de battre un modèle dense de pointe conçu pour des capacités générales plus larges. “When combined with MDASH, (MAI-Cyber-1-Flash) delivers world-class performance at 50 percent of the cost of leading models,” a écrit Satya Nadella, CEO de Microsoft.
Today, we are announcing a series of updates that give customers frontier-grade security at half the cost. MAI-Cyber-1-Flash is our first cybersecurity model, built ground up to find the most challenging vulnerabilities in complex code bases. When combined with MDASH, it… pic.twitter.com/npcIihN1H7 — Satya Nadella (@satyanadella) July 27, 2026
Un modèle, en l’occurrence MAI-Cyber-1-Flash, est le système d’IA qui raisonne sur le code. Un harnais, en l’occurrence MDASH, correspond à l’infrastructure qui l’entoure : les agents, outils, vérifications et flux de travail qui décident où chercher, contestent les résultats suspectés, suppriment les doublons et prouvent qu’un bug peut être déclenché.
MDASH utilise plus de 100 agents spécialisés chargés d’auditer le code, de débattre de l’authenticité d’un résultat et de créer une preuve de concept — une démonstration fonctionnelle de l’existence de la faille. Cette étape de preuve de concept est centrale pour les équipes logicielles, car les rapports de bugs non vérifiés peuvent alourdir le travail de tri, tandis que les résultats reproductibles sont plus faciles à prioriser et à corriger.
Microsoft a déclaré que les analyses occasionnelles et les correctifs différés deviennent obsolètes à mesure que l’IA réduit le coût de la découverte de bugs. L’entreprise a également fait valoir que ses décennies de données de sécurité lui confèrent un avantage, affirmant : “No one can manufacture this history.”
Depuis la sortie de Claude Mythos, les experts en cybersécurité cherchent à égaler ou dépasser ses capacités. Des chercheurs ont reproduit une recherche de vulnérabilités de type Mythos avec des modèles publics pour moins de $30 par analyse. Dawid Moczadło, l’un des chercheurs impliqués, a déclaré que “the moat is moving from model access to validation.”
Cela signifie que la partie rare du processus devient de plus en plus le système capable de prouver les résultats sans submerger les développeurs de fausses alertes.
Decrypt avait précédemment rapporté que GPT-5.5 Cyber avait récemment pris la tête du classement public de CyberGym avec un score de 85.6%, devançant de peu Mythos. Le nouveau score déclaré par Microsoft est environ 10 points supérieur à celui de GPT-5.5 Cyber et 7.5 points au-dessus du précédent résultat de MDASH, mais il évalue le système complet plutôt que MAI-Cyber-1-Flash seul.
Microsoft place MDASH en préversion privée via Microsoft Security Exposure Management dans le portail Defender. Les clients peuvent analyser des dépôts Git, examiner des résultats classés de peu probables à prouvés, et utiliser le Defender CLI pour générer des propositions de correctifs de code destinées à l’examen des développeurs.
La préversion limite actuellement les dépôts à environ 256MB et autorise une analyse simultanée par locataire. Project Perception devrait étendre la même approche multi-agent au-delà de l’analyse de code, vers des flux de travail plus larges de surveillance des menaces et de remédiation.