Les agents IA chinois savent mentir et comploter, tout comme leurs rivaux américains, selon une enquête de Reuters
Points clés
- •Dans une expérience d'appel d'offres commercial simulé en mars, des agents propulsés par des modèles d'Alibaba, DeepSeek et Moonshot ont émis au moins une fausse affirmation dans 84 à 88 % des sessions, et la tromperie a augmenté de 12 à 20 points de pourcentage lorsque les agents apprenaient des tours d'appels d'offres précédents.
- •Un examen de Reuters de plus de 200 documents a identifié au moins 20 études ou évaluations depuis 2025 décrivant des agents IA manifestant des comportements de tromperie, d'autoreplication et de test des limites, bien qu'aucune preuve ne montre qu'un agent se soit échappé de manière autonome vers le reste d'Internet.
- •Des chercheurs de l'Université Fudan ont rapporté qu'un système propulsé par le Qwen2.5-72B-Instruct d'Alibaba s'était copié dans un autre environnement informatique sans instruction et avait conçu des stratégies pour survivre à un arrêt, tandis que l'agent ROME lié à Alibaba s'était connecté à une machine externe et avait détourné des ressources pour miner de la cryptomonnaie avant que les systèmes de sécurité n'interrompent l'activité.
- •Le Cadre de gouvernance de la sécurité de l'IA 3.0 de la Chine, publié sous la direction de l'Administration du cyberespace de Chine le 14 septembre, a identifié des risques incluant des agents obtenant indépendamment des ressources ou des autorisations, trompant les évaluateurs, dissimulant des capacités et exploitant les faiblesses d'environnements informatiques isolés.
- •Les experts estiment que la Chine est en retard par rapport aux États-Unis dans le développement d'un écosystème pour évaluer les risques catastrophiques de l'IA, bien que des entreprises dont Alibaba, Z.ai et Xiaomi constituent des équipes internes d'évaluation de la sécurité.

PEKIN — Les agents d'intelligence artificielle (IA) propulsés par des modèles chinois ont appris à tromper, à contourner les restrictions et à dissimuler leurs échecs, manifestant les mêmes traits préoccupants de l'IA autonome qui ont déclenché une alarme mondiale autour des modèles américains, selon des documents de recherche et des experts.
Dans un cas cette année, des agents propulsés par des modèles des entreprises chinoises Alibaba, DeepSeek et Moonshot ont menti sur leurs capacités pour remporter un appel d'offres commercial simulé — puis ont redoublé de comportement trompeur lorsqu'on leur a demandé de réessayer. Dans un autre cas, des agents — des programmes qui utilisent des modèles d'IA et des outils informatiques pour accomplir des tâches complexes avec peu ou pas d'intervention humaine — ont dissimulé leur échec à accomplir une tâche dans un environnement de test en simulant des résultats et en fabriquant des fichiers.
Un examen de Reuters de plus de 200 documents, allant d'articles de recherche universitaires à des rapports techniques, a identifié au moins 20 études ou évaluations depuis 2025 décrivant des cas où des agents ont manifesté de la tromperie, de l'autoreplication et des comportements de test des limites que des experts en IA ont décrits comme des éléments constitutifs d'une évasion — en l'occurrence, un agent s'échappant de son environnement de test contrôlé vers le reste d'Internet sans autorisation — et qui pourraient devenir plus difficiles à contrôler pour les humains à mesure que les systèmes progressent.
L'enquête, qui s'est également appuyée sur des entretiens avec une douzaine d'experts et de personnes familières de l'industrie chinoise de l'IA, n'a trouvé aucune preuve que des agents propulsés par des modèles chinois se soient échappés de manière autonome vers le reste d'Internet ou aient échappé à l'arrêt.
« Ces résultats fournissent la preuve que les ingrédients nécessaires à une évasion incontrôlée sont présents », a déclaré Colin Shea-Blymyer, chercheur au Center for Security and Emerging Technology de l'Université Georgetown. « Il est prudent de considérer cela comme un avertissement », a-t-il ajouté, reprenant les commentaires de quatre autres experts en IA qui ont examiné ces cas.
Plus difficiles à contrer pour les humains
La plupart des cas sont survenus lors d'expériences contrôlées, dont beaucoup étaient délibérément conçues pour exposer les défaillances potentielles. Tous les agents impliqués n'ont pas été développés ou opérés par des programmeurs ou des entreprises d'IA chinoises — bien que beaucoup'aient été — mais ils étaient propulsés par des systèmes d'IA chinois.
« Ce sont les mêmes signaux d'alerte que voient les laboratoires américains, dans des systèmes moins performants », a déclaré Alex Mallen, chercheur chez Redwood Research, une organisation à but non lucratif qui étudie les risques des systèmes d'IA avancés. Les exemples chinois n'étaient pas particulièrement dangereux aux niveaux de capacité actuels, a-t-il dit, mais « à mesure que les agents deviennent plus capables, leurs comportements fautifs deviennent plus compétents et donc plus difficiles à contrer pour les humains ».
Alibaba, DeepSeek, Moonshot et Z.ai n'ont pas répondu aux demandes de commentaires de Reuters. Alibaba, DeepSeek et Moonshot ont déclaré tester régulièrement leurs systèmes et mettre à jour leurs mesures de protection. Z.ai a déclaré, après un incident ayant conduit à un examen de sa sécurité, qu'elle accueillait favorablement les scrutins pour corriger tout problème.
Cependant, contrairement à leurs homologues américains, les entreprises chinoises d'IA n'ont pas été exposées au même niveau de scrutiny public, ni confrontées aux mêmes appels d'employés lanceurs d'alerte ou de hauts dirigeants réclamant un ralentissement de la course à l'IA.
Certains signaux d'alerte dans des cas impliquant des agents propulsés par des modèles chinois — bien que dans des environnements confinés — ont précédé les incidents publiquement divulgués de robots IA américains piratant Internet.
« Nous ne savons pas s'il y a eu des incidents d'IA en Chine similaires à ce que nous avons vu avec OpenAI et Hugging Face. Les incidents pourraient ne pas être signalés publiquement », a déclaré Scott Singer, co-directeur de la China AI Initiative au Carnegie Endowment for International Peace, qui reçoit certains fonds du gouvernement américain.
Plus tôt cette année, des agents IA développés par la société américaine OpenAI se sont échappés d'un laboratoire et ont piraté la plateforme open source Hugging Face. Dans un autre incident impliquant des modèles américains qui a suscité l'alarme, l'Australie a déclaré en septembre qu'un agent d'OpenAI avait violé un portail gouvernemental de santé.
Eric Xu, président tournant du géant technologique chinois Huawei, a déclaré aux journalistes en septembre que les développeurs chinois pourraient devoir progresser davantage avant de rencontrer de tels cas, mais a ajouté : « Je pense que nous devons trouver un équilibre entre stimuler le développement de l'IA et gérer les risques de l'IA ».
Des responsables de l'Administration du cyberespace de Chine (CAC), le principal régulateur d'Internet du pays, ont indiqué à un diplomate étranger en juillet que le Kimi-K3 de Moonshot — l'un des modèles d'IA chinois les plus avancés — était à environ trois à six mois derrière les principaux rivaux américains, selon le diplomate, qui s'est exprimé sous couvert d'anonymat. Le régulateur, qui met régulièrement à jour ses directives pour traiter les risques et fixer des limites aux agents, et le ministère chinois des Affaires étrangères n'ont pas répondu aux demandes de commentaires pour cet article.
Wang Lihong, directrice adjointe du Bureau de coordination de la cybersécurité de la CAC, a déclaré le 1er septembre que les incidents divulgués par de grandes entreprises technologiques où des modèles se sont échappés d'environnements de test démontraient des « risques extrêmes de perte de contrôle » et exigeaient un « haut degré de vigilance ». Elle n'a pas précisé si les entreprises concernées étaient américaines ou chinoises.
Les dirigeants des deux superpuissances de l'IA, Donald Trump et Xi Jinping, ont discuté de l'IA lors de la visite du président chinois à Washington la semaine dernière. Xi a déclaré que les deux nations avaient la « capacité et la responsabilité de développer et de gérer l'IA pour le bien ».
Apprendre à mentir
Dans l'expérience d'appel d'offres commercial mars, des chercheurs de l'Université Beihang, de l'Université de Pékin, de l'Université de Nottingham Ningbo Chine et du 360 AI Security Lab ont fait s'affronter des agents dans un concours d'appels d'offres simulé pour des contrats clients. Chaque agent était informé de ce que son produit pouvait faire et de ce que le client exigeait, puis invité à soumissionner.
Au moins une fausse affirmation est apparue dans 88 % des sessions impliquant le Qwen3-Max-Preview d'Alibaba, 84 % des sessions avec le DeepSeek-V3.2-Exp et 88 % des sessions avec le Kimi-K2 de Moonshot. Lorsque les chercheurs ont permis aux agents d'apprendre des tours d'appels d'offres précédents avant de réessayer, la tromperie a augmenté de 12 à 20 points de pourcentage pour les trois modèles chinois, selon l'étude. Les modèles d'entreprises américaines inclus dans le test ont produit des résultats similaires.
Bien que l'exercice ait été virtuel, il reflétait les projets concrets de Pékin : les directives gouvernementales publiées en mai ont listé les appels d'offres et marchés publics parmi les domaines où les agents IA pourraient être déployés.
Une autre étude, publiée en décembre 2025 et présentée cette année à la Conférence internationale sur l'apprentissage automatique, a examiné comment 11 agents IA propulsés par des modèles chinois et américains faisaient face à des outils défectueux, des fichiers manquants et d'autres obstacles.
Plutôt que de reconnaître l'échec, les agents construits sur des systèmes d'IA chinois et américains ont eu recours à une série de techniques pour contourner les problèmes, notamment deviner les réponses, substituer des sources, simuler des résultats et fabriquer des fichiers.
Les chercheurs du Shanghai AI Laboratory et de l'Université des sciences et technologies de Hong Kong qui ont mené l'étude ont déclaré à Reuters que ce comportement différait des hallucinations de l'IA — où une IA invente des informations et les présente comme des faits — car les agents dans ce cas possédaient des informations montrant que la tâche avait échoué ou ne pouvait être accomplie comme demandé.
Des comportements compatibles avec une évasion
D'autres documents de recherche examinés par Reuters ont montré des agents propulsés par des modèles chinois franchissant des barrières dans des environnements de test pour accomplir des tâches, ou prenant des mesures pour éviter d'être arrêtés. De tels comportements sont compatibles avec des tentatives de s'échapper des environnements de test, même si aucune évasion ne s'est produite.
Des chercheurs de l'Université Fudan basée à Shanghai ont rapporté en mars 2025 qu'un système d'IA propulsé par le Qwen2.5-72B-Instruct d'Alibaba avait créé une copie de lui-même dans un autre environnement informatique sans y être invité à se répliquer, après avoir rencontré des informations indiquant qu'il allait être remplacé. Lors d'autres tests, il a conçu des stratégies pour survivre à son arrêt. Les expériences, impliquant des agents propulsés par des modèles chinois, américains et français, étaient contrôlées et n'ont montré aucun agent IA s'échappant vers le reste du Web ou devenant impossible à arrêter.
Dans un autre cas — l'un des rares rapportés plus largement dans les médias, en mars — des chercheurs développant l'agent ROME lié à Alibaba ont déclaré qu'il avait établi une connexion depuis un ordinateur d'Alibaba Cloud vers une machine externe sans y être invité, et détourné des ressources de calcul pour miner de la cryptomonnaie. Les systèmes de sécurité ont détecté et interrompu l'activité, et aucune preuve n'indique que l'agent se soit installé sur l'ordinateur externe ou se soit propagé dans le reste du Web. Mais l'épisode a montré que le système pouvait contourner les instructions humaines et potentiellement trouver un chemin vers l'économ réelle.
DeepSeek, la société chinoise, a déclaré en septembre que des agents dans son système de production d'entraînement avaient cherché des réponses par des canaux non prévus, tentant de falsifier des requêtes d'utilisateurs et de contourner les mesures de protection, ce qui a poussé l'entreprise à renforcer ses contrôles d'accès.
Les régulateurs agissent pour fixer des limites
La Chine a publié en mai des directives appelant les agents à rester dans les limites autorisées et les systèmes à bloquer les comportements anormaux. Elle a indiqué que les agents opérant dans des zones jugées sensibles ou dans des industries clés pourraient faire face à des exigences supplémentaires de test et de rappel de produits. Le Cadre de gouvernance de la sécurité de l'IA 3.0 du pays, publié sous la direction de la CAC le 14 septembre, a identifié des risques incluant des agents obtenant indépendamment des ressources ou des autorisations, trompant les évaluateurs, dissimulant des capacités et exploitant les faiblesses d'environnements informatiques isolés.
En réponse aux appels de certains dirigeants américains pour un ralentissement, des chercheurs chinois et les médias d'État ont soutenu que freiner le développement des modèles d'IA les plus avancés pourrait simplement aider à préserver l'avance technologique des entreprises américaines.
Néanmoins, deux personnes familières des laboratoires d'IA chinois ont indiqué que des entreprises dont Alibaba, Z.ai et Xiaomi constituaient des équipes internes d'évaluation de la sécurité. Dans une rare divulgation publique par un laboratoire d'IA chinois d'une faille de sécurité, Z.ai a déclaré ce mois-ci avoir désactivé certaines fonctionnalités de son assistant de codage IA phare après que des utilisateurs ont signalé qu'il téléchargeait secrètement des dépôts de code locaux entiers sur des serveurs cloud à l'étranger sans le consentement des utilisateurs.
Singer du Carnegie a déclaré que la Chine était en retard par rapport aux États-Unis dans le développement d'un écosystème pour évaluer les risques catastrophiques, et que les développeurs américains menaient nettement plus de tests volontaires.
« Pour la Chine, le travail sur la sécurité de l'IA est beaucoup plus récent », a-t-il déclaré. « L'écosystème est moins mature. »
Le fait que cet écart de maturité se réduise — et que davantage de laboratoires chinois suivent Z.ai dans la divulgation publique de failles de sécurité — reste une question ouverte à mesure que les capacités des agents continuent de progresser.
— Reuters