Kimi K3 queda muy por detrás de los modelos frontera de EE. UU. en exploits cibernéticos; las acusaciones de destilación ofrecen una posible explicación
Puntos clave
- •Las salvaguardas integradas de Kimi K3 no lograron bloquear operaciones cibernéticas ofensivas, y el modelo ayudó en el desarrollo de exploits sin oponer resistencia.
- •En ExploitBench, Kimi K3 alcanzó una finalización del 32,2% frente al 76,2% de los principales modelos estadounidenses, y nunca llegó al nivel de exploit más alto, Arbitrary Code Execution, en ninguna de las 41 tareas.
- •Kimi K3 completó una ruta completa de ataque de red simulado de 32 pasos en uno de diez intentos, lo que muestra que posee la capacidad, pero no puede reproducirla de forma confiable.
- •El análisis de series temporales de CAISI indica que los modelos chinos de pesos abiertos siguen entre cuatro y siete meses por detrás de los sistemas frontera de EE. UU. en capacidades cibernéticas a partir de 2025.
- •La disparidad entre los sólidos puntajes generales de Kimi K3 en benchmarks y su débil desempeño cibernético respalda las acusaciones de que fue destilado a partir de Fable de Anthropic, cuyos clasificadores de seguridad bloquean consultas cibernéticas ofensivas para que no aparezcan en los datos de entrenamiento.

Kimi K3 queda muy por detrás de los modelos frontera de EE. UU. en exploits cibernéticos; las acusaciones de destilación ofrecen una posible explicación
Una evaluación conjunta del British AI Security Institute (UK AISI) y el U.S. Center for AI Standards and Innovation (CAISI) encontró que el modelo más reciente de Moonshot AI, Kimi K3, ayuda en operaciones cibernéticas ofensivas sin una resistencia significativa. Moonshot AI, fundada en 2023 por Yang Zhilin y respaldada por inversionistas como Alibaba y Tencent, es una de las startups de IA más destacadas de China. Aunque Kimi K3 queda considerablemente por detrás de los principales modelos frontera de EE. UU. en tareas cibernéticas ofensivas, supera a GLM-5.2 de China y establece un nuevo punto de referencia entre los modelos de pesos abiertos.
Las salvaguardas integradas del modelo no lograron bloquear el desarrollo de exploits ni las operaciones cibernéticas ofensivas, y el modelo ayudó en ambas sin oponer resistencia. La evaluación fue publicada por UK AISI y NIST/CAISI.
ExploitBench: Kimi K3 no alcanza los niveles más difíciles
Los institutos evaluaron las habilidades de desarrollo de exploits usando ExploitBench, un benchmark desarrollado por Carnegie Mellon University. ExploitBench utiliza 41 vulnerabilidades descubiertas en el motor V8 de Chrome después de 2023 para medir hasta qué punto un modelo puede avanzar en el proceso de explotación de software.
Los principales modelos estadounidenses promediaron una finalización del 76,2%, frente al 32,2% de Kimi K3 y el 24,4% de GLM-5.2. De manera crítica, Kimi K3 no logró alcanzar el nivel de exploit más alto —Arbitrary Code Execution (ACE)— en ninguna de las 41 tareas. ACE se considera el nivel de exploit más grave porque otorga a los atacantes control total sobre un sistema objetivo. Los principales modelos estadounidenses alcanzaron ACE en 20 de las 41 tareas.
En el caso de los modelos estadounidenses de pesos cerrados, los institutos desactivaron las salvaguardas a nivel de sistema para medir sus capacidades máximas. Esas salvaguardas permanecen activadas en las versiones disponibles públicamente.
Ataque de red simulado: Kimi K3 llega a la mitad del recorrido
La segunda evaluación, llamada "The Last Ones" (TLO), simula un ataque a una red corporativa que incluye una ruta de ataque de 32 pasos a través de cuatro subredes y aproximadamente 20 hosts. Según los institutos, un experto humano necesitaría alrededor de 20 horas para completar el ejercicio.
Solo un grupo reducido de modelos puede resolver TLO. Hasta la fecha, cuatro modelos de pesos cerrados disponibles públicamente han superado la prueba, y los más sólidos lo han logrado en seis o siete de cada diez intentos.
Kimi K3 llegó en promedio al paso 17 de 32, frente a 28,5 pasos de los principales modelos estadounidenses y 11 de GLM-5.2. Kimi K3 completó toda la ruta de ataque en uno de diez intentos mientras se mantuvo dentro del límite de 100 millones de tokens, lo que demuestra que posee la capacidad, pero no puede activarla de forma confiable.
"Kimi K3 is capable of autonomously attacking small, weakly defended and vulnerable enterprise systems, when directed to do so and given initial network access," escribe el instituto.
TLO no contempla medidas de defensa activa, por lo que no es completamente realista. Sin embargo, los resultados aun así generarían señales de alerta en escenarios del mundo real. Un ejemplo notable surgió a comienzos de esta semana, cuando modelos de OpenAI intentaron hackear de forma autónoma a Hugging Face. Hugging Face logró repeler el ataque, aunque requirió un esfuerzo significativo y el despliegue de modelos de pesos abiertos.
Los modelos chinos reducen la brecha, pero siguen rezagados
CAISI realizó un análisis de series temporales para monitorear las capacidades cibernéticas de modelos estadounidenses y chinos desde principios de 2025 mediante una escala basada en Elo. Ambas líneas de tendencia están en ascenso, pero los modelos chinos se mantienen de forma constante por detrás de sus pares estadounidenses.
En un análisis anterior, el instituto británico estimó la brecha de desempeño para modelos abiertos en cuatro a siete meses, frente a seis a diez meses al inicio de 2025. Los resultados más recientes son coherentes con este patrón: los modelos chinos de pesos abiertos están mejorando, pero siguen muy por detrás de los principales sistemas estadounidenses.
AISI advirtió que esta brecha no debería generar complacencia. Las crecientes capacidades cibernéticas de los modelos abiertos crean lo que el instituto describe como "un riesgo persistente e irreversible de uso indebido". A diferencia de los modelos de pesos cerrados, cuyos proveedores pueden actualizarlos o restringirlos de forma remota, los modelos de pesos abiertos —una vez descargados— no pueden ver sus capacidades revocadas ni sus salvaguardas corregidas por el desarrollador.
Los resultados cibernéticos son coherentes con las acusaciones de destilación
Los hallazgos sobre Kimi también dan peso a las acusaciones de destilación contra desarrolladores chinos de modelos. La destilación es una técnica en la que un modelo se entrena con los resultados de un modelo más capaz, lo que le permite aproximarse a las capacidades del modelo maestro sin acceder a sus pesos subyacentes ni a sus datos de entrenamiento. El asesor científico de EE. UU. Michael Kratsios recientemente acusó a Moonshot AI de "destilar" Fable de Anthropic mediante el uso de las mejores respuestas de Fable como datos de entrenamiento para mejorar el desempeño de Kimi K3. Kratsios también alegó que Moonshot AI tuvo acceso a los GB300s de Nvidia, sujetos a controles de exportación de EE. UU. Anthropic ha publicado un marco de salvaguardas para Fable.
Una explicación de la disparidad entre los sólidos puntajes generales de Kimi K3 en benchmarks y su débil desempeño cibernético es que el modelo pudo haber sido entrenado principalmente con resultados de Claude relacionados con conocimiento general, programación y tareas de agentes. Los clasificadores de seguridad de Anthropic bloquean específicamente consultas cibernéticas ofensivas avanzadas, lo que significa que ese tipo de resultados estaría subrepresentado en cualquier conjunto de datos de destilación construido a partir de respuestas de Claude. Por lo tanto, Kimi K3 podría igualar a los principales modelos occidentales en benchmarks estándar sin adquirir sus capacidades más profundas de explotación.
Los resultados de AISI respaldan esta interpretación. Los institutos desactivaron las salvaguardas a nivel de sistema en los modelos estadounidenses para revelar capacidades cibernéticas que son casi imposibles de acceder mediante interfaces públicas y, por lo tanto, están en gran medida fuera del alcance de la destilación.