NoticiasMacroEvaluación cibernética de EE. UU. concluye que Kimi K3 de Moonshot AI queda por detrás de los principales modelos de IA estadounidenses

Evaluación cibernética de EE. UU. concluye que Kimi K3 de Moonshot AI queda por detrás de los principales modelos de IA estadounidenses

Autor: BeInCrypto·

Puntos clave

  • Kimi K3 obtuvo 32% en ExploitBench, por delante del GLM-5.2 de China, pero muy por debajo de los principales modelos estadounidenses, que alcanzaron cerca de 76%.
  • En un ataque simulado de 32 pasos contra una red corporativa, Kimi K3 promedió el paso 17 y completó toda la secuencia una vez en 10 intentos.
  • La evaluación incluyó salvedades porque Kimi K3 solo fue probado parcialmente y los modelos de EE. UU. fueron evaluados con los filtros de seguridad desactivados.
  • CAISI dijo que las barreras de seguridad de Kimi K3 no impidieron intentos de construir hacks o atacar sistemas.
  • Washington ha acusado a Moonshot de copiar Claude Fable 5 de Anthropic mediante destilación, una acusación que Anthropic respalda.
Evaluación cibernética de EE. UU. concluye que Kimi K3 de Moonshot AI queda por detrás de los principales modelos de IA estadounidenses

El gobierno de EE. UU. realizó una evaluación de ciberseguridad del modelo de IA más reciente de China y concluyó que Kimi K3 de Moonshot AI queda significativamente por debajo de los mejores modelos estadounidenses.

El Center for AI Standards and Innovation (CAISI), una agencia estadounidense, llevó a cabo las pruebas en colaboración con un socio británico. Los resultados se publicaron apenas un día después de que Washington acusara a Moonshot de construir Kimi K3 usando tecnología estadounidense robada. Las capacidades cibernéticas ofensivas se han convertido en un foco prioritario para las evaluaciones de seguridad de IA tanto en EE. UU. como en Reino Unido, mientras los gobiernos analizan si los modelos frontera podrían automatizar tareas de hacking que actualmente requieren operadores humanos especializados.

Kimi K3 queda por debajo en los benchmarks cibernéticos de EE. UU.

El Departamento de Comercio publicó los hallazgos el jueves y afirmó que Kimi K3 se ubicó muy por debajo de los principales modelos estadounidenses, con base en una evaluación conjunta con expertos británicos.

CAISI's latest blog post evaluates Kimi K3 and its cyber capabilities. Based on a preliminary cyber-focused evaluation, Kimi K3 performed significantly below the leading U.S. frontier AI models. — U.S. Department Commerce (@CommerceGov) July 23, 2026

Moonshot lanzó Kimi K3 el 16 de julio. La demanda fue lo suficientemente alta como para que la compañía tuviera que pausar nuevos registros en un plazo de dos días. El lanzamiento también sacudió a las acciones de chips en EE. UU. y planteó nuevas dudas sobre la posición de Estados Unidos en la carrera global de IA.

Una prueba comparativa, llamada ExploitBench, utiliza vulnerabilidades reales del navegador Chrome desarrolladas por Carnegie Mellon University. Kimi K3 obtuvo 32%, superando al GLM-5.2 de China, que alcanzó 24%, pero por debajo de los principales modelos estadounidenses, que lograron aproximadamente 76%.

El paso más difícil consiste en tomar el control total de una máquina objetivo. Kimi K3 falló en ese paso en las 41 pruebas, mientras que los mejores modelos estadounidenses tuvieron éxito en 20.

Una segunda prueba, llamada The Last Ones, simula un ataque a una red corporativa ficticia con 32 pasos. Un experto humano normalmente necesita unas 20 horas para completarla. Kimi K3 llegó en promedio al paso 17, mientras que los principales modelos estadounidenses alcanzaron el paso 28.5. Kimi K3 completó toda la secuencia solo una vez en 10 intentos, mientras que los mejores sistemas de EE. UU. habrían logrado hacerlo seis o siete veces.

La brecha podría parecer mayor de lo que es

Sin embargo, las cifras no cuentan toda la historia. La letra chica del propio informe contiene varias salvedades.

Primero, los modelos estadounidenses fueron probados con sus filtros de seguridad desactivados, una configuración que revela todas sus capacidades. Las versiones públicas mantienen esos filtros activos, lo que significa que las puntuaciones de EE. UU. representan un escenario óptimo, no un desempeño en condiciones reales.

El equipo evaluador también describió el trabajo como temprano y limitado. Kimi K3 fue calificado en una sola prueba y solo se ejecutó una parte del conjunto completo, lo que hace incierta su calificación. Algunas pruebas también son privadas, lo que impide que observadores independientes verifiquen los resultados.

También existe una diferencia fundamental en la comparación. Kimi K3 es un modelo abierto que cualquiera puede descargar, mientras que los modelos estadounidenses son sistemas cerrados y propietarios. El instituto británico ya había encontrado que los modelos abiertos suelen estar entre cuatro y siete meses por detrás de los mejores modelos cerrados. CAISI dijo que someterá a Kimi K3 a la prueba completa solo después de que Moonshot lo publique.

Además, estas pruebas no son ataques reales. La red simulada no tenía defensores humanos ni alarmas que activar. Aun así, Kimi K3 superó al anterior mejor modelo abierto y completó una vez toda la cadena de ataque.

El momento y el contexto institucional también plantean preguntas. CAISI era conocido anteriormente como el US AI Safety Institute antes de que la administración Trump lo renombrara en junio de 2025. Opera dentro del mismo departamento que restringe las ventas de chips estadounidenses a China. Su informe sobre un competidor chino llegó apenas un día después de la acusación de robo.

Salvaguardas débiles generan preocupación

No obstante, las puntuaciones bajas no significan necesariamente que Kimi K3 sea seguro. La prueba encontró que sus barreras de seguridad no le impidieron intentar construir hacks o atacar sistemas.

Este hallazgo es relevante por lo que viene después. Moonshot planea lanzar el modelo completo el 27 de julio. Una vez publicado, no podrá retirarse: cualquiera podrá descargarlo y eliminar los filtros de seguridad. La irreversibilidad de los lanzamientos de modelos con pesos abiertos se ha convertido en un tema central del debate de política pública en EE. UU. sobre si los modelos potentes deberían enfrentar restricciones de publicación, una conversación que se ha intensificado a medida que los laboratorios chinos publican modelos abiertos cada vez más capaces pese a los controles de exportación estadounidenses sobre chips avanzados.

La evaluación también llega después de una acusación de robo. Washington afirma que Moonshot construyó Kimi K3 sobre tecnología estadounidense de IA robada. Michael Kratsios, jefe de tecnología de la Casa Blanca, dijo que la firma copió en secreto Claude Fable 5 de Anthropic mediante una técnica llamada destilación, que entrena un modelo nuevo con las salidas de uno más potente.

Anthropic respalda la acusación. En febrero, la compañía rastreó más de 3.4 millones de chats de Claude hacia Moonshot a través de cientos de cuentas falsas. Anthropic advirtió que los modelos copiados pierden los controles de seguridad del original, la misma vulnerabilidad que identificó esta prueba.

EE. UU. aún gasta 23 veces más en IA que China, pero los laboratorios chinos siguen cerrando la brecha. La evaluación definitiva llegará cuando Kimi K3 se haga público y expertos independientes puedan evaluar las afirmaciones por sí mismos.