Une évaluation cyber américaine estime que Kimi K3 de Moonshot AI reste derrière les meilleurs modèles d’IA américains
Points clés
- •Kimi K3 a obtenu 32 % sur ExploitBench, devant le GLM-5.2 chinois, mais très loin des principaux modèles américains, autour de 76 %.
- •Dans une attaque simulée de réseau d’entreprise en 32 étapes, Kimi K3 a atteint en moyenne l’étape 17 et a complété toute la séquence une fois en 10 tentatives.
- •L’évaluation comporte des réserves, car Kimi K3 n’a été testé que partiellement et les modèles américains ont été évalués avec leurs filtres de sécurité désactivés.
- •Le CAISI a indiqué que les garde-fous de Kimi K3 n’empêchaient pas les tentatives de création d’outils de piratage ou d’attaque de systèmes.
- •Washington accuse Moonshot d’avoir copié Claude Fable 5 d’Anthropic par distillation, une accusation soutenue par Anthropic.

Le gouvernement américain a mené une évaluation de cybersécurité du plus récent modèle d’IA chinois, concluant que Kimi K3 de Moonshot AI reste nettement en deçà des meilleurs modèles américains.
Le Center for AI Standards and Innovation (CAISI), une agence américaine, a réalisé les tests en collaboration avec un partenaire britannique. Les résultats ont été publiés seulement un jour après que Washington a accusé Moonshot d’avoir construit Kimi K3 à partir d’une technologie américaine volée. Les capacités cyber offensives sont devenues une priorité dans les évaluations de sûreté de l’IA aux États-Unis comme au Royaume-Uni, alors que les gouvernements cherchent à déterminer si les modèles de pointe pourraient automatiser des tâches de piratage qui nécessitent actuellement des opérateurs humains qualifiés.
Kimi K3 reste en retrait sur les benchmarks cyber américains
Le département du Commerce a publié les conclusions jeudi, indiquant que Kimi K3 se classait largement derrière les meilleurs modèles américains sur la base d’une évaluation conjointe avec des experts britanniques.
CAISI's latest blog post evaluates Kimi K3 and its cyber capabilities. Based on a preliminary cyber-focused evaluation, Kimi K3 performed significantly below the leading U.S. frontier AI models. — U.S. Department Commerce (@CommerceGov) July 23, 2026
Moonshot a lancé Kimi K3 le 16 juillet. La demande a été suffisamment forte pour contraindre l’entreprise à suspendre les nouvelles inscriptions en moins de deux jours. Le lancement a également provoqué des remous parmi les valeurs américaines des semi-conducteurs et ravivé les interrogations sur la position des États-Unis dans la course mondiale à l’IA.
Un benchmark, appelé ExploitBench, utilise de véritables vulnérabilités du navigateur Chrome développées par Carnegie Mellon University. Kimi K3 a obtenu 32 %, devant le GLM-5.2 chinois à 24 %, mais derrière les principaux modèles américains, qui ont atteint environ 76 %.
L’étape la plus difficile consiste à prendre le contrôle complet d’une machine cible. Kimi K3 a échoué à cette étape dans les 41 tests, tandis que les meilleurs modèles américains ont réussi dans 20 cas.
Un deuxième test, appelé The Last Ones, simule une attaque contre un faux réseau d’entreprise en 32 étapes. Un expert humain a généralement besoin d’environ 20 heures pour le terminer. Kimi K3 a atteint en moyenne l’étape 17, tandis que les meilleurs modèles américains ont atteint l’étape 28,5. Kimi K3 a achevé toute la séquence une seule fois en 10 tentatives, alors que les meilleurs systèmes américains y seraient parvenus six ou sept fois.
L’écart pourrait paraître plus important qu’il ne l’est
Toutefois, les chiffres ne disent pas tout. Les notes de bas de page du rapport comportent plusieurs réserves.
Premièrement, les modèles américains ont été testés avec leurs filtres de sécurité désactivés, un réglage qui révèle l’ensemble de leurs capacités. Les versions publiques conservent ces filtres actifs, ce qui signifie que les scores américains représentent un scénario optimal plutôt qu’une performance en conditions réelles.
L’équipe d’évaluation a également décrit ces travaux comme préliminaires et limités. Kimi K3 n’a été noté que sur un seul test, et seule une partie de la suite complète a été exécutée, ce qui rend son évaluation incertaine. Certains tests sont également privés, ce qui empêche les observateurs indépendants de vérifier les résultats.
La comparaison présente aussi une différence fondamentale. Kimi K3 est un modèle ouvert que chacun peut télécharger, tandis que les modèles américains sont des systèmes fermés et propriétaires. L’institut britannique a précédemment constaté que les modèles ouverts accusent généralement un retard de quatre à sept mois sur les meilleurs modèles fermés. Le CAISI a indiqué qu’il ne soumettrait Kimi K3 à la batterie complète de tests qu’après sa publication par Moonshot.
En outre, ces tests ne sont pas de véritables attaques. Le réseau simulé ne comportait ni défenseurs humains ni alarmes à déclencher. Malgré cela, Kimi K3 a surpassé le précédent meilleur modèle ouvert et a bien complété une fois toute la chaîne d’attaque.
Le calendrier et le contexte institutionnel soulèvent également des questions. Le CAISI était auparavant connu sous le nom de US AI Safety Institute avant d’être renommé par l’administration Trump en juin 2025. Il opère au sein du même département qui restreint les ventes de puces américaines à la Chine. Son rapport sur un concurrent chinois est arrivé seulement un jour après l’accusation de vol.
Des garde-fous faibles suscitent des inquiétudes
Des scores faibles ne signifient toutefois pas nécessairement que Kimi K3 est sûr. Le test a montré que ses garde-fous ne l’empêchaient pas de tenter de créer des outils de piratage ou d’attaquer des systèmes.
Ce constat est important au regard de la suite. Moonshot prévoit de publier le modèle complet le 27 juillet. Une fois publié, il ne pourra pas être rappelé : n’importe qui pourra le télécharger et retirer les filtres de sécurité. L’irréversibilité des publications de modèles à poids ouverts est devenue un enjeu central du débat politique américain sur l’opportunité d’imposer des restrictions à la diffusion des modèles puissants, une discussion qui s’est intensifiée à mesure que les laboratoires chinois publient des modèles ouverts de plus en plus performants malgré les contrôles américains à l’exportation sur les puces avancées.
L’évaluation intervient également après une accusation de vol. Washington affirme que Moonshot a construit Kimi K3 à partir d’une technologie d’IA américaine volée. Michael Kratsios, responsable technologique de la Maison-Blanche, a déclaré que l’entreprise avait secrètement copié Claude Fable 5 d’Anthropic au moyen d’une technique appelée distillation, qui consiste à entraîner un nouveau modèle sur les sorties d’un modèle plus puissant.
Anthropic soutient cette accusation. En février, l’entreprise a relié plus de 3,4 millions de conversations Claude à Moonshot via des centaines de faux comptes. Anthropic a averti que les modèles copiés perdent les contrôles de sécurité de l’original — la même vulnérabilité que ce test a identifiée.
Les États-Unis dépensent encore 23 fois plus que la Chine dans l’IA, mais les laboratoires chinois continuent de réduire l’écart. L’évaluation décisive interviendra lorsque Kimi K3 sera rendu public et que des experts indépendants pourront examiner eux-mêmes ces affirmations.