L'IA peut désormais démasquer vos comptes anonymes : ce qu'ont découvert les études de l'ETH Zurich et d'Anthropic
Points clés
- •Des chercheurs de l'ETH Zurich, de MATS et d'Anthropic ont mis au point un pipeline d'IA ayant associé des comptes anonymisés de Hacker News à des profils LinkedIn avec une précision de 90 %, en utilisant uniquement la recherche web, les embeddings et des modèles de raisonnement.
- •Chaque opération de déanonymisation coûtait entre 1 et 4 dollars et ne nécessitait ni fuite de données, ni piratage, ni accès interne, ce qui rend l'attaque difficile à bloquer selon les chercheurs.
- •Lors d'un test portant sur 338 utilisateurs de Hacker News ayant lié leur profil LinkedIn dans leur bio, l'IA en a correctement identifié 226, soit environ 67 % du groupe.
- •L'étude a utilisé un dispositif contrôlé en conditions optimales, et face à un pool de 89 000 candidats, la méthode la plus puissante n'a trouvé qu'environ la moitié des bonnes correspondances, avec une précision de 90 %.
- •Les auteurs ont gardé leur code, leurs prompts et toutes les identités réelles découvertes confidentiels, et l'étude a été validée par le comité d'éthique de l'ETH Zurich avant sa publication.

Des chercheurs de l'ETH Zurich, du groupe de sécurité de l'IA MATS et d'Anthropic ont mis au point un pipeline d'IA qui a permis d'associer des comptes anonymisés de Hacker News à de vrais profils LinkedIn avec une précision de 90 % — sans piratage ni fuite de données. Selon l'étude, l'attaque s'appuie uniquement sur la recherche web, les embeddings et des modèles de raisonnement comme GPT-5.2, pour un coût d'environ 1 à 4 dollars par cible.
Les auteurs de l'étude ont gardé leur code, leurs prompts et toutes les identités réelles qu'ils ont découvertes confidentiels, et affirment que l'étude a été validée par le comité d'éthique de l'ETH Zurich avant sa publication.
Ces recherches, publiées pour la première fois en février, ont à nouveau circulé cette semaine sur X et Reddit, suscitant une réaction immédiate : de nombreux utilisateurs des réseaux sociaux alarmés ont déclaré qu'il s'agissait de la fin de l'anonymat sur Internet telle qu'ils la connaissaient.
L'étude, intitulée "Large-scale online deanonymization with LLMs", est disponible sur arXiv et émane de chercheurs de l'ETH Zurich et du groupe de sécurité de l'IA MATS, en collaboration avec Nicholas Carlini, chercheur chez Anthropic, la société à l'origine de Claude. Les chercheurs affirment que les grands modèles de langage — les systèmes d'IA derrière Claude, ChatGPT et Gemini — peuvent lire les messages anonymes d'une personne et déterminer qui elle est dans la vie réelle. Aucun système n'est piraté ; les modèles se contentent de lire, de chercher et de raisonner, les mêmes tâches que ces chatbots accomplissent déjà des millions de fois par jour.
L'alarme en ligne a été illustrée par un post X largement partagé :
Researchers built an AI that doxes any "anonymous" reddit account in under a minutes for $2. eth zurich and anthropic published a terrifying paper proving that "practical anonymity" on the internet is officially dead. they built a fully autonomous ai pipeline that takes your… pic.twitter.com/XMeXifhDf3
"Nos résultats montrent que l'obscurité pratique protégeant les utilisateurs pseudonymes en ligne ne tient plus et que les modèles de menace pour la confidentialité en ligne doivent être repensés", indique l'étude.
Comment l'IA s'y prend concrètement
Les chercheurs ont décomposé l'attaque en quatre étapes qu'ils appellent Extract, Search, Reason et Calibrate.
"Extract" consiste à fournir à une IA les messages d'une personne et à lui faire résumer qui elle est : où elle vit peut-être, son métier, ses loisirs, voire une particularité comme l'orthographe britannique ou le nom d'un chien mentionné en passant.
"Search" transforme ce résumé en un embedding — une chaîne de nombres qu'un ordinateur peut utiliser pour trouver instantanément des profils au profil similaire parmi des milliers de candidats.
"Reason" est l'étape où un modèle plus puissant examine les meilleures correspondances et détermine laquelle convient réellement, en recoupant les détails comme le ferait un enquêteur humain, mais bien plus rapidement.
Calibrate" amène l'IA à évaluer sa propre confiance, de sorte qu'elle ne fait une supposition que lorsqu'elle en est relativement sûre et reste sinon silencieuse.
Lors d'un test, l'équipe a rassemblé 338 utilisateurs du forum Hacker News, majoritairement pseudonyme, qui avaient lié leur profil LinkedIn dans leur bio, a supprimé toute information identifiante, puis a demandé à un agent d'IA de déterminer qui ils étaient en utilisant uniquement la recherche web. Il a correctement identifié 226 d'entre eux — 67 % — et s'est trompé sur environ une supposition sur dix de celles qu'il a effectivement formulées. Ces deux chiffres résument la logique centrale de l'étude : chaque fois que le système a risqué une supposition, il avait raison environ neuf fois sur dix, et sur l'ensemble du groupe, il a nommé deux cibles sur trois.
Lors d'un test distinct mené sur des transcriptions des entretiens de recherche d'Anthropic avec 125 scientifiques, l'IA a correctement identifié au moins 9 personnes rien qu'à partir de la façon dont elles décrivaient leur travail.
La véritable découverte, c'est le coût
Selon l'étude, l'exécution d'une de ces recherches coûte entre 1 et 4 dollars d'abonnements à des services d'IA. L'attaque ne nécessite ni fuite de données, ni piratage, ni accès interne. Elle utilise les mêmes capacités de recherche web et de résumé intégrées aux chatbots ordinaires.
C'est précisément pourquoi, selon les chercheurs, elle est difficile à bloquer : il n'existe pas d'interrupteur unique "déanonymiser cette personne" à désactiver, seulement une chaîne de tâches individuellement inoffensives en apparence. Pour les entreprises qui construisent ces modèles, cela complique les mesures d'atténuation : le risque n'est pas un défaut d'un produit en particulier, mais un usage involontaire des mêmes capacités de recherche et de résumé qui rendent les chatbots utiles en premier lieu.
Ce n'est d'ailleurs pas la première fois que quelques détails suffisent à démasquer quelqu'un. En 2008, des chercheurs avaient percé à jour le jeu de données de notations de films de Netflix, réputé anonyme, en le recoupant avec les avis publics d'IMDb. La différence aujourd'hui, c'est que l'IA effectue le recoupement sur du texte désordonné et non structuré — blagues, commentaires, mentions anodines — plutôt que sur des tableaux bien ordonnés, et qu'elle accomplit ce travail toute seule.
Maintenant, la partie "tout le monde, restez calmes"
Les chiffres les plus alarmants de l'étude comportent une nuance. Pour mesurer leur taux de réussite, les chercheurs avaient besoin de sujets dont ils connaissaient déjà la véritable identité ; ils ont donc choisi des comptes déjà liés à LinkedIn, ou ont divisé l'historique de messages d'une même personne en deux moitiés en masquant le lien. Il s'agit d'un dispositif contrôlé, en conditions optimales — et non de la preuve que n'importe quel compte pseudonyme peut être déchiffré dès aujourd'hui.
L'échelle joue également contre les chiffres les plus inquiétants de l'étude. Plus la meule de candidats potentiels est grande, plus l'aiguille est difficile à trouver. Face à un pool de 89 000 candidats, la méthode d'IA la plus puissante n'a trouvé qu'environ la moitié des bonnes correspondances, avec une précision de 90 %. La précision désigne la fréquence à laquelle les suppositions du système étaient correctes ; le rappel désigne le nombre de vraies correspondances effectivement détectées.
Les chercheurs n'ont pas plus publié leurs outils, leurs prompts ni aucun des vrais noms découverts, et l'étude a été examinée par un comité d'éthique avant sa publication. Ils ne fournissent à personne une trousse de doxxing. Ils documentent une capacité que, selon les auteurs, les modèles d'IA actuels possèdent déjà, étude publiée ou non.
Pourquoi cela importe même si vous n'avez jamais posté sur Reddit
Les utilisateurs de crypto connaissent intimement cette crainte. Une vague de doxxings et de tentatives d'enlèvement à la suite de la fuite de données Coinbase de 2025, parmi bien d'autres, a montré à quelle vitesse une identité divulguée peut se transformer en une vraie adresse devant la porte de quelqu'un. La déanonymisation par l'IA est la même menace sans la fuite : elle s'appuie sur ce que vous avez déjà publié en public, aucune fuite n'étant nécessaire.
L'étude intervient également quelques mois après la divulgation par Anthropic selon laquelle des hackers soutenus par un État ont utilisé Claude pour mener l'essentiel d'une campagne de cyberespionnage de leur propre chef, rappelant que la recherche sur les usages abusifs de l'IA dépasse continuellement les garde-fous censés les contenir.
Pour toute personne qui poste sous un pseudonyme en raison de son militantisme, de situations d'abus, de sa sexualité, de son statut migratoire ou d'un métier qui désapprouve les opinions publiques, cette découverte signifie que la ville natale, l'employeur et même le nom d'un animal de compagnie — éparpillés sur des années d'anciens commentaires — forment une empreinte digitale. Cela a toujours été possible ; l'IA le rend simplement plus rapide et moins cher. Une partie de la difficulté tient à une asymétrie : changer sa façon de poster demain n'a aucun effet sur les années de commentaires déjà présents en public, et la méthode s'appuie précisément sur cet archive.
Pour ceux que ce type de doxxing préoccupe, la réponse n'est pas la panique mais l'habitude : associer moins de détails spécifiques et identifiants à un pseudonyme donné, et pour tout ce qui est réellement sensible, utiliser des outils conçus pour ne pas conserver vos données du tout.