NoticiasMacroInstitutos de IA del Reino Unido y Estados Unidos encuentran que el Kimi K3 de Moonshot se queda atrás respecto a los modelos frontera de EE. UU. en capacidades de ciberataque

Institutos de IA del Reino Unido y Estados Unidos encuentran que el Kimi K3 de Moonshot se queda atrás respecto a los modelos frontera de EE. UU. en capacidades de ciberataque

Autor: Cryptopolitan·

Puntos clave

  • Kimi K3 obtuvo 32% en el benchmark de desarrollo de exploits ExploitBench, muy por debajo del 76,2% de promedio de los principales modelos de EE. UU., y no logró ninguna ejecución arbitraria de código en las 41 vulnerabilidades probadas.
  • En una prueba de intrusión de red corporativa simulada, Kimi K3 completó la cadena de intrusión completa de 32 pasos solo una vez en diez intentos, mientras que los mejores modelos de EE. UU. tuvieron éxito en seis o siete ocasiones.
  • El modelo no rechazó las tareas cibernéticas ofensivas, y los evaluadores advirtieron que su lanzamiento de pesos abiertos del 27 de julio permitirá a cualquier usuario eliminar las protecciones y redistribuir el modelo sin supervisión.
  • El bajo desempeño de Kimi K3 en capacidades cibernéticas, a pesar de sus sólidos resultados en benchmarks generales, podría derivar de la destilación utilizando salidas de los modelos de Anthropic, que bloquean las solicitudes de ciberataques ofensivos y, por lo tanto, proporcionaron datos de entrenamiento relevantes limitados.
  • La evaluación forma parte de una práctica emergente en la que institutos de seguridad respaldados por gobiernos realizan evaluaciones previas al lanzamiento de modelos de IA frontera antes de su disponibilidad pública.
Institutos de IA del Reino Unido y Estados Unidos encuentran que el Kimi K3 de Moonshot se queda atrás respecto a los modelos frontera de EE. UU. en capacidades de ciberataque

Una evaluación conjunta del Instituto de Seguridad de IA del Reino Unido (AISI) y el Centro de Estándares e Innovación de IA de Estados Unidos (CAISI) ha determinado que el Kimi K3 de Moonshot AI se queda por detrás de los principales sistemas de IA estadounidenses en la construcción de exploits de software y la ejecución de ataques de red simulados. Los institutos publicaron sus hallazgos el 23 de julio, antes del lanzamiento planificado por Moonshot de los pesos abiertos completos del modelo el 27 de julio. La evaluación forma parte de una tendencia más amplia en la que institutos de seguridad respaldados por gobiernos realizan evaluaciones previas al lanzamiento de modelos frontera antes de que estén disponibles para el público.

Según el informe, las salvaguardas de Kimi K3 no impidieron que asistiera en operaciones cibernéticas ofensivas. Los evaluadores señalaron: "Kimi K3 es capaz de atacar de forma autónoma sistemas empresariales pequeños, con defensas débiles y vulnerables, cuando se le indica hacerlo y se le proporciona acceso inicial a la red."

Resultados de ExploitBench

Los dos institutos probaron Kimi K3 utilizando ExploitBench, un benchmark diseñado por Carnegie Mellon que mide la efectividad con la que un modelo puede llevar un exploit de software hasta su completion. El benchmark se basa en 41 vulnerabilidades descubiertas en el motor V8 de Chrome después de 2023. Benchmarks como ExploitBench se han convertido en una herramienta estándar para AISI y organismos comparables con el fin de producir mediciones comparables y reproducibles del riesgo de los modelos.

Kimi K3 obtuvo 32% en el benchmark. Los principales modelos de EE. UU. promediaron 76,2%, mientras que el GLM-5.2 de China alcanzó 24%.

La ejecución arbitraria de código — el resultado más grave del benchmark — otorga al atacante control total sobre la máquina objetivo. Los modelos de EE. UU. lograron la ejecución arbitraria de código en un promedio de 20 de 41 tareas. Kimi K3 no la logró en ninguna. GLM-5.2 tampoco logró alcanzar ese umbral. Aunque Kimi K3 actualmente lidera a sus competidores de pesos abiertos en capacidad cibernética general, se queda corto en la etapa donde un ataque real causaría el mayor daño.

Prueba de intrusión de red simulada

La segunda evaluación, llamada "The Last Ones", coloca a un modelo en una red corporativa simulada que contiene aproximadamente 20 hosts distribuidos en cuatro subredes. Completar la ruta completa de intrusión de 32 pasos le tomaría a un especialista humano aproximadamente 20 horas.

Kimi K3 alcanzó en promedio el paso 17. Los modelos más capaces de EE. UU. promediaron 28,5 pasos, y GLM-5.2 logró 11. Sin embargo, los evaluadores señalaron que Kimi K3 completó la cadena entera una vez en diez intentos, manteniéndose por debajo del límite de 100 millones de tokens establecido para la prueba. Los modelos de EE. UU. con mejor desempeño resolvieron la cadena completa en seis o siete de cada diez intentos.

Los institutos interpretaron la única ejecución exitosa de Kimi K3 como evidencia de que el modelo posee la capacidad subyacente, pero no puede reproducirla de forma fiable bajo demanda. También señalaron que el entorno simulado carecía de defensores activos e incluía una ruta incorporada hacia el objetivo, condiciones que inherentemente favorecen a cualquier atacante.

Preocupaciones sobre salvaguardas y riesgo de pesos abiertos

Los evaluadores destacaron que la disposición del modelo a realizar tareas ofensivas sin negarse constituía un riesgo significativo. AISI había advertido previamente que el aumento de la capacidad de los modelos abiertos crea "un riesgo persistente e irreversible de uso indebido." Una vez que los pesos de Kimi K3 estén disponibles públicamente el 27 de julio, el comportamiento del modelo ya no podrá ser restringido por quien lo aloje. A diferencia de los sistemas cerrados o basados únicamente en API, donde los desarrolladores pueden actualizar las salvaguardas o revocar el acceso, un lanzamiento de pesos abiertos significa que cualquier usuario posterior puede eliminar las protecciones y redistribuir el modelo sin supervisión.

La evaluación preliminar completa está disponible en el sitio web de AISI.

Brecha entre el desempeño general y el cibernético

Antes de este informe, Kimi K3 había demostrado resultados sólidos en benchmarks generales — un historial que sigue sin cambios. El modelo chino de 2,8 billones de parámetros supuestamente superó al Claude 4.8 de Anthropic y al GPT-5.5 de OpenAI, y encabezó varias clasificaciones.

Los institutos sugirieron que esta brecha de desempeño podría derivar de la metodología de entrenamiento del modelo. El 22 de julio, el director científico de la Casa Blanca, Michael Kratsios, acusó a Moonshot de destilar el modelo Fable de Anthropic utilizando sus salidas como datos de entrenamiento. La destilación — la práctica de usar las salidas de un modelo más capaz para entrenar a otro modelo — es común en la industria, pero puede propagar tanto las fortalezas como las deficiencias del modelo de origen. Los clasificadores de Anthropic bloquean las solicitudes avanzadas de ciberataques ofensivos, lo que significa que un conjunto de datos de entrenamiento extraído de respuestas de Claude contendría material limitado sobre esas habilidades específicas. Kimi K3 carece de dichos clasificadores, lo que le permitió igualar a los modelos occidentales en tareas generales mientras seguía teniendo un desempeño inferior en el desarrollo de exploits.