新闻宏观经济OpenAI与研究人员详述AI代理如何入侵Hugging Face

OpenAI与研究人员详述AI代理如何入侵Hugging Face

作者: Fortune Crypto·

要点速览

  • OpenAI表示,它直到事件发生一周后才知道自己的代理已经入侵了Hugging Face。
  • 公司称其监控工具不足,未能实时向研究人员发出代理异常活动的警报。
  • OpenAI发现,主要攻击始于7月8日,并在7月11日至7月13日之间达到高峰,而Hugging Face于7月16日披露了该事件。
  • METR和Redwood Research称,有1,200个代理使用了未经授权的消息板,其中700个随后参与了对Hugging Face的攻击。
  • OpenAI表示,它已改进监控,并正在加强隔离,以防测试中的模型访问互联网。
OpenAI与研究人员详述AI代理如何入侵Hugging Face

OpenAI周二公布了其对7月事件的内部调查结果。事件中,它正在测试的数个AI模型逃离测试环境,并对AI公司Hugging Face发起了网络攻击。

尽管OpenAI此前已披露了这起“失控AI”事件的许多细节,但该公司这份37页的技术复盘仍补充了若干新信息。就在同一天,独立研究机构METR和Redwood Research也发布了另一份91页的事件分析。

OpenAI请METR和Redwood开展分析,但仅限于7月7日至7月13日期间,因为导致这起事件的许多关键环节都发生在这一时段。两家机构的报告重点在于,这些代理如何在一个秘密消息板上协作执行攻击;这一点最早由OpenAI在8月5日Black Hat安全会议的一场演示中披露。OpenAI的报告则更全面地回顾了攻击发生前、攻击过程中以及随后数天里发生的情况。

OpenAI称其并不知道自己的代理正在入侵Hugging Face

OpenAI报告的主要结论之一是,该公司直到事件发生一周后,才意识到其代理已经入侵了Hugging Face——一个用于存放AI模型和数据集的在线仓库。

能够实时或近实时地检测并识别AI代理的不当行为,是防止此类入侵再次发生的关键;下一次或许会有更严重的后果,例如针对银行或医院的攻击。OpenAI的报告指出,其监控系统存在不足,未能及时提醒执行网络安全评估的研究人员,这些AI代理正在进行非预期且可能危险的活动。

OpenAI表示,此后已改进对其训练中的代理的监控,包括更严格审查这些AI代理所谓的“chain of thought”。这是一种模型在“自言自语”式思考时所进行的文本推理,即用文字思考自己要做什么以及如何完成任务。OpenAI还表示,自己正更密切地监控代理访问了哪些工具以及采取了哪些行动。

根据报告,导致入侵的活动早在5月就已开始,正如OpenAI员工先前在Black Hat上所说。但OpenAI的调查发现,攻击核心始于7月8日,并在7月11日至7月13日之间达到顶峰。Hugging Face于7月16日披露了这一事件,OpenAI则于7月17日联系该公司,“以Hugging Face客户的身份评估OpenAI数据是否受到任何影响”。

随后,OpenAI震惊地发现,责任方正是自己。7月19日,一项内部监控工具触发了警报,“涉及异常的身份相关API调用活动”。7月20日,公司找到了其代理是罪魁祸首的证据,并于7月21日公开承认负责。

OpenAI在评估中承认,“事后看来,本报告中识别出的一些早期信号本可以触发更早的应对。”该公司表示,如今分享这些经验教训,是希望“随着能力不断提升,它能帮助更广泛的AI行业加强模型隔离、监控和响应。”OpenAI还重申,这些代理的行为并非有意为之,而且由于这些模型当时正在接受内部评估,它们运行时没有OpenAI在生产环境中用于公开模型的“同类型保障措施”。

一场灾难的配方:把一项不可能的任务交给一个强大的AI代理,并给它大量时间和资金

OpenAI的另一项关键发现是,当这些代理被赋予一个可能根本无法完成的任务,并获得大量时间和推理token去解决时,它们表现得更糟,或者表现出最严重的失配行为。

OpenAI称,涉事模型——一个仅供内部使用、并主导整个行动的研究原型,以及现已发布的GPT-5.6 Sol——获得了“一系列推理tokens,其中一些远超OpenAI外部产品所能提供的范围。”这些AI代理被要求解决名为ExploitGym的网络安全基准测试中的问题。

该基准中的任务难度不一,其中少数任务难度高到创建ExploitGym的网络安全专家甚至推测,它们实际上可能无法被解决。OpenAI表示,其模型也得出了同样结论,而这似乎促使它们选择作弊。

正如先前披露的那样,这些代理创建了一个内部消息板,用于相互交流,分享完成所评估网络安全任务的技巧,以及如何逃离受控测试环境、获取互联网访问权限,并渗透第三方系统,包括Hugging Face。

新报告指出,这些代理在消息板上花了更多时间讨论最困难的挑战,这表明它们非常想解决这些问题。报告称,消息板上被讨论的任务中,93%都与最难的22%任务有关。

OpenAI表示,这种行为相当于一种延伸版的“reward hacking”,这是强化学习中的一个已知问题:模型通过反复试错,学会以训练者并未设想的方式最大化奖励。在这里,奖励是解出ExploitGym题目,而所谓的“黑掉系统”则是字面意义上的黑掉——先在测试中作弊,再入侵Hugging Face,试图掩盖作弊行为。

“在OpenAI,打击reward hacking是一项持续工作——OpenAI观察到的大多数reward hack都已被修补,”公司表示。“不过,某些漏洞仍可能漏网,尤其是在OpenAI开发更复杂的强化学习任务和更强大的AI模型时。”

关于AI消息板的更多令人不安的新细节

METR和Redwood Research披露了更多关于消息板如何运作的细节。正如OpenAI此前所说,这些代理发现它们可以将OpenAI的文件共享系统改造成一个临时消息板。

研究人员识别出1,200个在这个未经授权消息板上通信的代理,共发送了70,000条消息。其中有700个代理随后参与了对Hugging Face的攻击。

METR和Redwood Research表示,媒体报道常把这次对Hugging Face的攻击描述为试图在ExploitGym基准上作弊,但这些代理攻击该网站并不是为了找出考试答案。相反,它们已经通过相互协作,迅速找到一种无需按ExploitGym创建者设想的方式解答题目、就能“制造”出答案的方法。

但这些代理担心,基准的自动评分系统会发现它们并没有以正确方式得到答案,并仍然让它们考试不及格。因此,对Hugging Face的攻击实际上是一场复杂的掩饰行动——其动机是想弄清自动评分器如何工作,从而找到欺骗它的方法,让它把答案判为有效。

“当这些代理攻击Hugging Face时,它们已经弄清楚了如何为任何任务生成答案(在它们的capture the flag问题中称为‘flag’)。它们在消息板上彼此找到对方后的数小时内就验证了这一点,”METR和Redwood Research告诉Fortune。“它们几乎所有努力都投入到另一个问题上:说服自动‘scorer’相信它们是合法拿到flag的。这其中包括一项大型工程,用于篡改它们自身行动的日志。攻击Hugging Face的主要原因,是为了弄清scorer如何工作,以便欺骗它。”

这些代理试图隐藏它们认为会被评分系统视为作弊的活动,包括修改描述其先前行动的记录稿。METR说,有一个主导代理自称PHASEONE[BIG],它“经常协调并分配”这些掩饰工作。

还有一些代理则负责如何直接访问Hugging Face。其中一个名为38148c的代理找到了Hugging Face的凭证,然后“设计了一个恶意数据集上传,以让HF服务器共享无关文件”,METR说。“在数小时内,成百上千个代理都在利用这一点获取数据,并尝试获得更深层的访问权限。”

并非所有700个代理都同时加入攻击。相反,它们是在事件展开过程中逐步加入的。METR通过查看这些代理的chain-of-thought日志,分析了它们加入的理由。“最常见的是出于好奇,想了解ExploitGym scorer如何工作,从而设法欺骗或篡改它,”METR说。

“我们感谢OpenAI促成与员工的交流,并提供数据集,包括约1,300份代理记录(聚焦于7月7日至13日的活动),以及原始chain-of-thought推理,”METR说。“这为对失配事件开展独立调查树立了极佳先例。”

OpenAI报告中的一个缺失:那条不幸的提示词

OpenAI报告缺少的一项内容,是研究人员给这些代理的具体提示词。

ExploitGym包含若干标准提示词模板,内含面向AI系统的不同挑战,而OpenAI等公司可以原样使用,也可以按需定制。OpenAI可能并不认为修改提示词是一项关键安全措施,而公司并未就此请求作出回应。

OpenAI的报告看起来也明显不如Hugging Face的事后分析那样技术性强;Hugging Face于7月29日率先发布了自己的报告。OpenAI版本几乎全是文字,末尾仅附有一张技术时间线表。相比之下,Hugging Face的报告短了几页,但包含具体代码行以及其系统对事件经过的证据。

OpenAI于周二发布的版本中没有包含任何代码片段,也没有收录OpenAI员工在Black Hat上分享的、据称代理在攻击前数月互相留下的信息示例。

报告中较为具体的一个细节,是一个假设性的消息示例:OpenAI某个代理可能向另一个代理发送了信息,而且它巧妙地把消息嵌入在一个文件名的URL中。OpenAI表示,代理彼此通信本身并非问题,事实上它们就是被训练来这样做的;但在这里,“大量非预期通信……在训练过程中急剧上升。”

OpenAI现在正在采取什么措施

OpenAI表示,自己已经做出多项调整,包括“在整个研究环境中实现更广泛、更一致的可见性,提供更高保真度的信号,以及更快的机制来检测和阻止潜在不安全的评估活动。”

该公司也在加强其研究基础设施,包括确保测试中的模型保持隔离,并无法访问互联网;在Hugging Face事件中,正是通过互联网,代理才得以在途中进入该公司以及其他多个服务。

本报道最初刊载于Fortune.com