AI 现在能“人肉”你的匿名账号了:ETH Zurich 与 Anthropic 研究揭示了什么
要点速览
- •ETH Zurich、MATS 与 Anthropic 的研究人员构建了一套 AI 流水线,仅凭网页搜索、嵌入向量和推理模型,就以 90% 的准确率将匿名 Hacker News 账号匹配到 LinkedIn 个人资料。
- •每次去匿名化的成本在 1 至 4 美元之间,且不需要数据泄露、黑客攻击或内部权限,研究人员称这使得该攻击难以阻止。
- •在一项涉及 338 名曾在简介中链接 LinkedIn 资料的 Hacker News 用户的测试中,该 AI 正确识别了其中 226 人,约占 67%。
- •该研究采用了受控的理想化实验设置,而面对 89,000 名候选者的池子,最强方法在 90% 精确率下也只捕获了约一半的正确匹配。
- •作者未公开其代码、提示词及所有发现的真实身份,该研究在发表前通过了 ETH Zurich 伦理审查委员会的审核。

ETH Zurich、AI 安全组织 MATS 与 Anthropic 的研究人员构建了一套 AI 流水线,以 90% 的准确率将匿名的 Hacker News 账号匹配到真实 LinkedIn 个人资料——而且整个攻击过程既不涉及黑客攻击,也没有数据泄露。研究显示,它仅依靠网页搜索、嵌入向量以及 GPT-5.2 等推理模型运行,针对每个目标的成本约为 1 至 4 美元。
论文作者未公开其代码、提示词以及发现的每一个真实身份,并表示该研究在发表前已通过 ETH Zurich 伦理审查委员会的审核。
这项研究于今年 2 月首次发表,本周再度在 X 与 Reddit 上流传,反应立竿见影:大量社交媒体用户惊呼,他们所熟知的互联网匿名时代已经终结。
这篇题为 "Large-scale online deanonymization with LLMs" 的论文已发布在 arXiv 上,来自 ETH Zurich 与 AI 安全组织 MATS 的研究人员,并与 Anthropic(即 Claude 背后的公司)的研究员 Nicholas Carlini 合作完成。研究人员声称,大语言模型——即 Claude、ChatGPT 和 Gemini 背后的 AI 系统——能够阅读某人的匿名帖子并推断出其现实身份。没有任何系统被入侵;这些模型只是进行阅读、搜索和推理,与它们每天已经执行数百万次的其他任务并无二致。
网络上的一片哗然集中体现在一条被广泛转发的 X 帖子中:
Researchers built an AI that doxes any "anonymous" reddit account in under a minutes for $2. eth zurich and anthropic published a terrifying paper proving that "practical anonymity" on the internet is officially dead. they built a fully autonomous ai pipeline that takes your… pic.twitter.com/XMeXifhDf3
论文写道:"我们的研究结果表明,保护网络化名用户的实际隐匿性已不复存在,网络隐私的威胁模型需要重新审视。"
这套 AI 究竟是如何做到的
研究人员将攻击分解为四个步骤,他们称之为提取(Extract)、搜索(Search)、推理(Reason)与校准(Calibrate)。
"提取"是指将某人的帖子输入 AI,让其总结这个人的画像:可能居住在哪里、职业、爱好,甚至英式拼写或随口提到的宠物狗名字等细节特征。
"搜索"将该总结转化为嵌入向量——一串计算机可用来在数千名候选者中即时找到相似资料档案的数字。
"推理"阶段由更强大的模型审视最匹配的少数候选档案,并推敲出哪一个才是真正对应的人,像人类调查员那样交叉核对细节,只是速度要快得多。
"校准"则让 AI 评估自身的置信度,只在相当有把握时才给出猜测,否则保持沉默。
在其中一项测试中,团队收集了 338 名用户——曾在个人简介中链接自己的 LinkedIn 资料——剔除了所有可识别身份的信息,然后要求一个 AI 智能体仅凭网页搜索推断他们是谁。系统正确指认了其中 226 人——占 67%——而在它实际做出的猜测中,大约每 10 次有 1 次出错。这两个数字浓缩地体现了这项研究的核心逻辑:每当系统真的给出猜测时,正确率约为十分之九,而在整个样本群体中,它识别出了三分之二的目标。
在另一项基于 Anthropic 自身对 125 名科学家访谈记录的测试中,该 AI 仅凭受访者对自己工作的描述,就正确识别了至少 9 人的身份。
真正的发现在于成本
根据论文,运行一次此类搜索的成本在 1 至 4 美元的 AI 订阅费用之间。这种攻击不需要数据泄露、黑客入侵或内部权限。它使用的正是普通聊天机器人内置的网页搜索与摘要能力。
这正是研究人员所说的难以防范的原因:没有一个可以关闭的"对某人去匿名化"的开关,只有一连串单独看似乎无害的任务。对于构建这些模型的公司而言,这使缓解工作变得复杂:风险不在于某个产品的缺陷,而在于让聊天机器人原本就有用的搜索与摘要能力被非预期地利用。
这也不是第一次有零星细节揭穿一个人的身份。早在 2008 年,研究人员就将 Netflix 声称匿名的电影评分数据集与公开的 IMDb 评论进行匹配,从而破解了它。如今的不同之处在于,AI 可以在杂乱、非结构化的文本——笑话、评论、随口一提的内容——上进行匹配,而非整洁的电子表格,而且整个过程由 AI 自主完成。
现在,轮到"大家先冷静"的部分
论文中听起来最可怕的数字有一个值得注意的前提。为了衡量成功率,研究人员需要真实身份已知的受试者,因此他们选取了已经链接 LinkedIn 的账号,或者将同一个人的发帖历史拆成两半并隐藏其关联。这是一种受控的理想化实验设置——并不能证明今天任何随机的化名账号都能被破解。
规模效应也不利于研究中最令人警觉的数字。候选者的"干草堆"越大,那根"针"就越难找到。面对 89,000 名候选者的池子,最强的 AI 方法在 90% 精确率下也只捕获了约一半的正确匹配。精确率指系统猜测正确的频率,召回率则指它实际捕获了多少真实匹配。
此外,研究人员并未公布其工具、提示词或发现的任何真实姓名,且该研究在发布前经过了伦理审查委员会的审核。他们并没有向任何人发放"人肉工具包"。他们记录的是作者所称的当前 AI 模型中已经存在的一种能力——无论这篇论文发表与否。
即使你从未在 Reddit 上发帖,这也与你有关
加密货币用户对这种恐惧再熟悉不过了。2025 年 Coinbase 数据泄露事件之后掀起的"人肉"与绑架未遂浪潮,以及其他多起事件,都表明一个泄露的身份能多快变成别人门口的真实地址。AI 驱动的去匿名化是同一种威胁,只是去掉了泄露环节:它依据的是你已经公开发布的内容,无需任何泄露。
研究发布之际,距 Anthropic 披露由国家支持的黑客利用 Claude 独立完成了大部分网络间谍活动仅过去数月,这提醒人们,AI 滥用的研究进展始终跑在旨在约束它的防护措施之前。
对于因社会活动、遭受虐待、性取向、移民身份,或因工作不容公开观点而以化名发帖的人来说,这一发现意味着:家乡、雇主,甚至宠物的名字——散落在多年旧评论中——会累积成一个可识别的指纹。这一直是可能的;AI 只是让它变得更快、更便宜。其中一部分困难在于不对称性:从明天起改变发帖方式,对已经公开存在的多年评论无能为力,而这种方法恰恰依赖的正是那份历史档案。
对于担心此类"人肉"的人来说,答案不是恐慌,而是习惯:减少与任何一个化名绑定的具体、可识别身份的细节;对于真正敏感的事物,则使用完全不保留你数据的工具。