ニュースマクロETHチューリッヒとAnthropicの研究、LLMが1人あたり数ドルで匿名アカウントの正体を特定できると判明

ETHチューリッヒとAnthropicの研究、LLMが1人あたり数ドルで匿名アカウントの正体を特定できると判明

著者: Cryptopolitan·

重要ポイント

  • •パイプラインは、公開閲覧可能な投稿のみを用いて、338人のHacker Newsユーザーのうち226人(約67%)を90%の精度で正しく特定した。
  • •ベンチマーク全体のコストは2,000ドル未満で、特定された1プロファイルあたり平均約1〜4ドルであり、大規模な匿名化解除がいかに安価になったかを示している。
  • •システムはExtract、Search、Reason、Calibrateの4段階で動作し、不確実な場合には意図的に判断を保留することで誤検出を減らす。
  • •研究者たちはコード、プロンプト、実際の身元情報を公開しておらず、研究は公開前にETHチューリッヒの倫理委員会の審査に合格した。
  • •著者らは匿名アカウントを守ってきた事実上の匿名性はもはや成り立たないと結論づけ、ジャーナリスト、活動家、広告の標的、暗号資産ユーザーへのリスクを挙げている。
ETHチューリッヒとAnthropicの研究、LLMが1人あたり数ドルで匿名アカウントの正体を特定できると判明

ETHチューリッヒ、AI安全性研究グループMATS、Anthropicの研究者たちは、匿名のオンライン投稿を実世界の身元と結び付けることができる自動化されたLLMパイプラインを構築した。テストでは、このシステムは90%の精度で数百人のHacker Newsユーザーを特定し、コストは1人あたりわずか1ドルからだった。

この研究"Large-scale online deanonymization with LLMs"は、2月18日にarXivに初めて投稿され、その後、セキュリティ研究の主要な学術会議である第35回USENIX Security Symposiumの論文集に掲載された。今週、XとRedditで拡散されたことを受けて、改めて注目を集めている。

論文の著者は、Simon Lermen、Daniel Paleka、Joshua Swanson、Michael Aerni、Nicholas Carlini、Florian Tramèr。CarliniはClaudeモデルを手がけるAnthropicの社員であり、他のメンバーはETHチューリッヒとMATSに所属している。

4段階のプロセスで89,000人の候補を絞り込み

この攻撃には、盗まれたデータやハッキングされたサーバーは不要だ。エージェントは誰でも公開閲覧できる情報のみを扱い、辛抱強い調査員の仕事をより安価かつ迅速にこなす。

研究者たちはこのプロセスを4段階に分割した。Extract、SearchReason、Calibrateの各段階だ。まず、言語モデルが生の投稿から、職業、居住地、特徴的な文章の癖といった身元の手がかりを抽出する。次にセマンティック埋め込みが、最大89,000人の候補プールを絞り込みリストにする。推論モデルが最も有力な一致を評価し、2つのアカウントが同一人物かどうかを判断する。Calibrate段階では、確信が持てない場合にパイプラインが判断を保留するため、誤検出が減る。

パイプラインは既製のツール、すなわちウェブ検索、埋め込み、GPT-5.2などのモデル上で動作する。匿名化されたNetflix評価データの2008年の再識別攻撃といった従来の匿名化解除攻撃は、構造化データに依存していた。この事例は、一見匿名のレコードでも外部情報との突き合わせによって正体を暴かれ得ることを示し、今回説明された自動化された低コスト手法の、データ大量依存型の先駆けとなった。

338人のHacker Newsユーザーのうち226人を90%の精度で特定

実際の人々を危険にさらすことなく手法を評価するため、チームはプロフィールにLinkedInページへのリンクを記載した338人のHacker Newsユーザー(スタートアップアクセラレーターY Combinatorが運営する技術フォーラム)からなるベンチマークを構築し、各ユーザーの正しい身元(グラウンドトゥルース)を確認した。各ユーザーのコメントと投稿のみを与えられたエージェントは、90%の精度で226人(約67%)を正しく特定した。25件の誤判定を行い、86アカウントでは判断を保留した。従来の非LLMベースラインは、論文の大規模マッチングテストでほぼゼロのスコアだった。

実験全体のコストは2,000ドル未満、プロファイルあたり約1〜4ドルだった。

さらに2つのデータセットで手法が検証された。1つは異なる2つの映画コミュニティ間でRedditユーザーをマッチングするもの、もう1つは単一のReddit履歴を2つの時期に分割して再構築するものだった。いずれでも、LLM手法は従来の技術を大きく上回った。

警告と安全対策

著者らは、ジャーナリストや活動家を標的とする政府、ますます精度を増す広告プロファイルを作る企業、ソーシャルエンジニアリング攻撃のために調査資料を蓄積する詐欺師など、幅広い悪用の可能性を指摘する。

「こうした情報の組み合わせは、しばしば固有の指紋となる」と、Lermenは2月24日のブログ記事に書いている。さらに、優秀な調査員のチームが投稿から人物を特定できるなら、LLMエージェントもおそらく可能であり、コストは下がり続けるだけだと付け加えた。

研究者たちは、コード、プロンプト、システムが特定した実際の身元情報をいずれも公開していない。研究は公開前にETHチューリッヒの倫理委員会による審査を受けている。

「オンラインの匿名ユーザーを守ってきた事実上の匿名性は、もはや成り立たない」と論文は結論づけている。この種の匿名性こそが、開発者フォーラムや暗号資産コミュニティに共通する大多数の匿名アカウントが、これまで依拠してきたものである。

本研究への注目が再燃したのは、SECコミッショナーのHester Peirceが大量のKYC(フィナンシャル機関がユーザーに対して実施が義務付けられている本人確認)データ収集に警告を発し、その手法は「ますます巨大なデータの干し草の山を作る」ことに等しいと述べた翌日のことだった。olutや、ハードウェアウォレットメーカーTrezor関連のベンダーで最近発生した情報漏洩を受け、「レンチ攻撃」、すなわち暗号資産を保有する人物を突き止めた者が直接訪ねてくる攻撃への懸念が高まっている。