Microsoft dice que MDASH supera a Claude Mythos y GPT-5.6 Sol en benchmark de ciberseguridad
Puntos clave
- •Microsoft dijo que MDASH con MAI-Cyber-1-Flash obtuvo 95.95% en CyberGym, que evalúa si los agentes de IA pueden reproducir vulnerabilidades conocidas.
- •El resultado reportado colocó al sistema de Microsoft por delante de GPT-5.5 Cyber, Mythos 5, GPT-5.6 Sol y Gemini 3.5 Flash Cyber en las puntuaciones citadas del benchmark.
- •MAI-Cyber-1-Flash maneja hasta 90% de las tareas en MDASH, mientras que el 10% más difícil se dirige a GPT-5.4.
- •MDASH usa más de 100 agentes especializados para revisar código, evaluar hallazgos y construir demostraciones de prueba de concepto.
- •Microsoft está poniendo MDASH a disposición en vista previa privada a través del portal Defender, con límites actuales de tamaño de repositorio y de escaneos concurrentes.

Microsoft presentó MAI-Cyber-1-Flash, su primer modelo dedicado a ciberseguridad, y lo integró en MDASH, un sistema de búsqueda de vulnerabilidades que, según la compañía, superó a Mythos 5 de Anthropic y a GPT-5.6 Sol de OpenAI, al tiempo que redujo los costos en 50% frente a la mejor configuración actual de MDASH de Microsoft.
Según Microsoft, la configuración combinada de MDASH obtuvo 95.95% en CyberGym, un benchmark que pide a agentes de IA reproducir 1,507 vulnerabilidades conocidas en 188 proyectos de código abierto. CyberGym califica los sistemas según el porcentaje de vulnerabilidades que logran reproducir en un entorno controlado.
Microsoft dijo que el resultado colocó a MDASH por delante de GPT-5.5 Cyber, con 85.6%; Mythos 5, con 83.8%; GPT-5.6 Sol, con 83.6%; y Gemini 3.5 Flash Cyber, con 83.2%. La puntuación fue reportada por la propia Microsoft y no había aparecido en la tabla pública de CyberGym al momento de la publicación, aunque el benchmark usa un conjunto de pruebas público y una métrica de éxito definida.
Benchmarks como CyberGym son relevantes porque evalúan si un agente puede ir más allá de marcar código sospechoso y reproducir efectivamente una falla conocida. Eso sigue siendo más limitado que demostrar cómo funcionará un sistema en bases de código privadas, pero ofrece a investigadores y equipos de seguridad una forma común de comparar sistemas de búsqueda de vulnerabilidades.
MAI-Cyber-1-Flash no opera por sí solo dentro del sistema. Microsoft dijo que el modelo maneja hasta 90% de las tareas, mientras que MDASH dirige el 10% más difícil a GPT-5.4. Ese enrutamiento es importante porque los tokens —los fragmentos de texto que procesa un modelo de IA— tienen un costo cada vez que un modelo lee código o genera una respuesta.
Microsoft describió el lanzamiento como la primera vez que uno de sus modelos enfocados en eficiencia logra superar a un modelo denso de última generación diseñado para capacidades generales más amplias. “When combined with MDASH, (MAI-Cyber-1-Flash) delivers world-class performance at 50 percent of the cost of leading models,” escribió Satya Nadella, CEO de Microsoft.
Today, we are announcing a series of updates that give customers frontier-grade security at half the cost. MAI-Cyber-1-Flash is our first cybersecurity model, built ground up to find the most challenging vulnerabilities in complex code bases. When combined with MDASH, it… pic.twitter.com/npcIihN1H7 — Satya Nadella (@satyanadella) July 27, 2026
Un modelo, en este caso MAI-Cyber-1-Flash, es el sistema de IA que razona sobre el código. Un arnés, en este caso MDASH, es la maquinaria que lo rodea: los agentes, herramientas, verificaciones y flujo de trabajo que deciden dónde buscar, cuestionan hallazgos sospechosos, eliminan duplicados y demuestran que un error puede activarse.
MDASH usa más de 100 agentes especializados asignados a auditar código, debatir si un hallazgo es genuino y construir una prueba de concepto: una demostración funcional de que la falla existe. Ese paso de prueba de concepto es central para los equipos de software porque los reportes de errores no verificados pueden generar trabajo adicional de clasificación, mientras que los hallazgos reproducibles son más fáciles de priorizar y corregir.
Microsoft dijo que los escaneos ocasionales y los parches demorados se están volviendo obsoletos a medida que la IA abarata el descubrimiento de errores. La compañía también sostuvo que sus décadas de datos de seguridad le dan una ventaja, al afirmar: “No one can manufacture this history.”
Desde el lanzamiento de Claude Mythos, expertos en ciberseguridad han intentado igualar o superar sus capacidades. Investigadores reprodujeron la búsqueda de vulnerabilidades al estilo Mythos con modelos públicos por menos de $30 por escaneo. Dawid Moczadło, uno de los investigadores involucrados, dijo que “the moat is moving from model access to validation.”
Eso significa que la parte escasa del proceso es cada vez más el sistema capaz de comprobar hallazgos sin abrumar a los desarrolladores con falsas alarmas.
Decrypt había informado anteriormente que GPT-5.5 Cyber había tomado recientemente el liderazgo público de CyberGym con una puntuación de 85.6%, superando por poco a Mythos. La nueva puntuación reportada por Microsoft es aproximadamente 10 puntos superior a la de GPT-5.5 Cyber y 7.5 puntos por encima del resultado anterior de MDASH, pero evalúa el sistema completo en lugar de MAI-Cyber-1-Flash por separado.
Microsoft está incorporando MDASH en una vista previa privada a través de Microsoft Security Exposure Management en el portal Defender. Los clientes pueden escanear repositorios Git, revisar hallazgos clasificados desde improbables hasta comprobados y usar Defender CLI para generar propuestas de correcciones de código que los desarrolladores puedan revisar.
La vista previa actualmente limita los repositorios a aproximadamente 256MB y permite un escaneo concurrente por inquilino. Se espera que Project Perception extienda el mismo enfoque multiagente más allá del escaneo de código hacia flujos de trabajo más amplios de monitoreo y remediación de amenazas.