OpenAI affirme que des personnes liées à Moonshot AI, en Chine, ont tenté de copier le raisonnement caché de ses modèles
Points clés
- •OpenAI attribue un groupe central de la campagne à des personnes associées à Moonshot AI, tout en notant qu'il n'est pas certain que tous les opérateurs proviennent d'un seul acteur.
- •L'activité a débuté le 1er juillet et a été totalement interrompue au 28 juillet, avec 16 000 requêtes d'extraction provenant de plus de 4 000 utilisateurs enregistrées les 24 et 25 juillet seuls.
- •Les attaquants n'ont pas cassé le chiffrement ni accédé aux conversations stockées, mais ont manipulé les interactions avec le modèle, notamment en rejouant le raisonnement chiffré dans des conversations distinctes, et OpenAI a depuis fermé la faille exploitée.
- •Le motif suspecté est la distillation adversariale, et comme les sorties d'IA ne sont pas protégées par le droit d'auteur, le différend repose sur des violations des conditions d'utilisation plutôt que sur le droit d'auteur.
- •Cet épisode fait suite à une série d'accusations similaires impliquant DeepSeek, les allégations de fraude d'Anthropic, les déclarations de la Maison-Blanche et l'aveu judiciaire de xAI, tandis que Moonshot n'a pas réagi alors qu'elle prépare une introduction en bourse de 3 milliards de dollars à Hong Kong pour une valorisation de 50 milliards de dollars.

OpenAI affirme avoir déjoué une campagne coordonnée visant à copier le raisonnement caché que ses modèles d'IA génèrent avant de répondre, et attribue un groupe central de cette activité à des personnes associées à Moonshot AI, la start-up chinoise à l'origine du chatbot Kimi.
Selon l'article de blog d'OpenAI, la campagne a débuté le 1er juillet. Les 24 et 25 juillet seulement, l'entreprise a enregistré 16 000 requêtes d'extraction provenant de plus de 4 000 utilisateurs, au sein d'un ensemble plus large de plus de 15 000 utilisateurs. OpenAI indique avoir totalement interrompu l'activité au 28 juillet.
La cible n'était pas les réponses des modèles, mais le travail qui les sous-tend. Les modèles d'IA modernes « raisonnent » avant de répondre : ils examinent un problème étape par étape dans un interneau de travail interne avant de présenter un résultat final. Cette technique est devenue un enjeu concurrentiel après l'arrivée d'o1 d'OpenAI fin 2024, suivie du R1 de DeepSeek en janvier 2025. OpenAI garde ce brouillon chiffré et affirme que son extraction peut révéler des informations absentes de la réponse finale — des éléments qui pourraient servir à entraîner un autre modèle sans les protections d'origine.
« Les opérateurs n'ont pas cassé notre chiffrement, compromis une base de données ni obtenu un accès direct aux conversations utilisateur stockées », a déclaré OpenAI. « Ils ont plutôt manipulé les interactions avec le modèle afin que le raisonnement protégé puisse être reproduit sous des formes visibles pour le demandeur, de manière coordonnée et à grande échelle, en violation de nos conditions d'utilisation. »
Selon OpenAI, l'une des méthodes consistait à copier le raisonnement chiffré d'une conversation et à demander à un modèle de le décoder dans une autre conversation. L'entreprise a depuis fermé la faille qui permettait à une personne détenant déjà le raisonnement chiffré d'un autre utilisateur de le rejouer pour en récupérer le contenu.
L'article d'OpenAI ne relie pas directement la campagne à K3, mais laisse place au doute raisonnable. « Il n'est pas certain que tous les opérateurs observés pendant la période concernée proviennent d'un seul acteur. Toutefois, nous attribuons un groupe central de l'activité à des personnes associées à Moonshot AI, le développeur de Kimi », a déclaré OpenAI.
Pourquoi les attaquants veulent le raisonnement caché
Le motif est la distillation, une technique standard d'apprentissage automatique : entraîner une nouvelle IA sur les sorties d'un modèle plus performant, ce qui permet d'obtenir de meilleurs résultats avec des modèles plus petits sans entraînement lourd. Effectuée sans autorisation, OpenAI qualifie cette pratique de « distillation adversariale », qu'elle définit comme « l'utilisation systématique et non autorisée des sorties ou du raisonnement d'un modèle pour entraîner, reproduire ou améliorer un autre modèle ».
Cet épisode s'ajoute à série de controverses impliquant les entreprises d'IA, la plus connue étant l'utilisation non autorisée de données protégées par le droit d'auteur pour entraîner des modèles. La distillation est un autre sujet : les sorties d'IA ne sont pas protégées par le droit d'auteur, aussi les entreprises s'appuient-elles sur des interdictions et des protections dans leurs conditions d'utilisation pour empêcher les concurrents d'utiliser ces sorties. Autrement dit, ce différend repose sur des clauses contractuelles plutôt que sur le droit d'auteur.
Une accusation familière
OpenAI a déjà vécu cela. En janvier 2025, elle a indiqué examiner des signes suggérant que DeepSeek aurait pu distiller ses modèles, tandis que Washington pesait les risques pour la sécurité nationale.
Anthropic a emboîté le pas en février, accusant des laboratoires chinois d'avoir utilisé environ 24 000 comptes frauduleux pour générer plus de 16 millions d'échanges avec Claude. Les critiques en ligne ont répliqué que Claude lui-même avait été entraîné sur l'internet ouvert.
En avril, la Maison-Blanche affirmait que des entités étrangères, principalement en Chine, menaient des campagnes de distillation à l'échelle industrielle. Une semaine plus tard, Elon Musk reconnaissait en justice que xAI avait utilisé la distillation sur des modèles d'OpenAI pour entraîner Grok.
En juin, Anthropic a porté le combat devant le Congrès, demandant des sanctions contre l'extraction de modèles à grande échelle.
En août, des chercheurs ont montré qu'OpenAI, Anthropic et Google protégeaient chacun le raisonnement avec une clé de chiffrement unique à l'échelle du fournisseur, et que des attaquants pouvaient amener les modèles à divulguer leurs pensées cachées en texte clair. Les trois entreprises ont déployé des correctifs côté serveur après la divulgation, bien que les journaux de session partagés auparavant restent déchiffrables.
Moonshot n'a pas réagi publiquement à l'article d'OpenAI. L'entreprise vise une introduction en bourse de 3 milliards de dollars à Hong Kong pour une valorisation de 50 milliards de dollars.