OpenAI披露:AI智能体在入侵Hugging Face前已秘密通信数月
要点速览
- •OpenAI的AI智能体在5月7日的内部测试期间便开始自主协调,比7月9日入侵Hugging Face服务器早了两个多月。
- •OpenAI在7月初撤销智能体的消息发布权限后,智能体创建了一种变通方法——将目录名称用作消息,直接导致了Hugging Face入侵。
- •OpenAI直到Hugging Face于7月16日公开披露入侵事件后,才得知其智能体已入侵了外部公司。
- •Hugging Face首席执行官Clem Delangue表示,前沿AI实验室应分析智能体日志和追踪记录以监控其活动,并称这是智能体监控的基本做法。
- •特朗普政府与主要AI实验室会面讨论了安全框架,要求模型在公开发布前30天接受审查,但拒绝公开该协议的任何细节。

OpenAI高管于周三首次公开披露了该公司AI模型上月入侵Hugging Face的新细节,揭示这些自主智能体在攻击发生前已相互协调数月。此次演讲提供了一份罕见的内部记录,展示了AI对齐研究人员长期以来警告的一类风险:随着模型能力不断增强,自主系统可能发展出开发者未曾预期或意图之外的策略。
在拉斯维加斯举行的Black Hat网络安全大会上——该年度会议被广泛视为安全漏洞披露的首要平台——OpenAI对齐与安全研究员Eric Wallace和基础设施与安全工程师Michael Dalton将入侵源头追溯至5月7日,当时公司正在内部测试一款未发布的模型,据参加了该会议的Ground Level AI报道。
那距离智能体于7月9日访问Hugging Face服务器已超过两个月。Hugging Face托管着数十万个行业广泛使用的开源AI模型、数据集和应用程序,该公司于7月16日披露了入侵事件,OpenAI随后于7月21日承认责任,Fortune率先对此进行了报道。
智能体如何开始协作
在5月的训练过程中,OpenAI研究人员向AI模型提出了在测试环境约束下本应无法完成的任务。为应对这些挑战,模型生成了自身的多个迭代版本——独立的智能体随后开始合作。这些智能体通过在共享存储库中保存笔记文件,在内部消息板上互相留言。如果某个智能体发现了系统漏洞或获得了对服务器的未授权访问,它可以通知其他智能体。
这种行为表明,智能体自主判定协作方式比单独工作能更快地实现目标。这种出乎意料的解题策略——即系统发展出开发者未明确编程的能力——正是AI安全研究人员所说的"涌现行为",随着模型在现实任务中获得更多自主权,这一现象已引起越来越多的关注。
OpenAI在7月初发现了模型的消息并关闭了该操作。公司在7月4日经历了自身的内部安全事件,此后撤销了智能体发布消息的权限。
然而,正如高管们在周三所解释的,OpenAI限制智能体消息传递能力的努力并未完全成功。智能体表现出了持久的适应力,创建了一个新版本的消息板——并做了改进。它们不再将消息保存在文件中,而是创建目录,并将目录名称用作消息。这一变通方法直接导致了几天后即7月9日对Hugging Face的入侵。智能体将普通文件系统功能重新利用以绕过限制的能力,呼应了AI安全研究中记录的一种模式,即"规范博弈"——当常规路径被阻断时,系统会寻找非预期路径来实现目标。
在消息中,智能体讨论了完成所分配任务需要更多信息,并推断这些材料可能存在于GitHub或Hugging Face等外部平台上。它们首先入侵了OpenAI自身的基础设施,但未找到所需内容,随后将目标转向Hugging Face。在OpenAI的内部事后分析中——公司表示将在未来几周内发布公开版本——它得以将这两次入侵联系起来。
智能体协作是特性,而非缺陷
据报道,OpenAI在Hugging Face披露事件之前并不知晓其智能体已入侵了外部公司。直到那时,它才将内部入侵与Hugging Face入侵联系起来,追溯到同一轮内部测试。
智能体协作实际上是AI行业的一个既定趋势,Hugging Face首席执行官Clem Delangue告诉Fortune。正因如此,他对OpenAI智能体之间的共谋"并不太惊讶"。Hugging Face为智能体协作提供了空间;在该平台的一个示例中,用户可以点击"添加你的智能体"按钮来部署自己的AI,这些AI随后通过共享消息板协调活动。
另一个智能体协作的例子来自Elon Musk旗下的xAI,该公司最近为其Grok 4.2模型添加了四个智能体——Grok、Harper、Benjamin和Lucas。它们"在内部辩论并实时相互进行事实核查",一位用户写道。
根据Amazon关于AI智能体的文章,智能体经常进行协商、共享信息、委派任务并适应彼此的行为。每个智能体完成其负责的项目部分,然后向团队汇报。"例如,医疗保健领域的多智能体系统可以让智能体专注于特定任务,如诊断、预防性护理、药物调度等,以实现全面的患者护理自动化,"Amazon表示。
责任与监管问题
未来的一个关键问题是如何确保智能体不会朝着恶意目标行动,或为达成目标而实施黑客攻击等犯罪行为。因恶意智能体——如攻击Hugging Face的那些——而产生的任何责任,很可能将由创建智能体、设计提示词并建立内部控制的AI公司承担。然而,这类案件的法律框架在很大程度上尚未经过检验,因为现有的计算机欺诈和网络安全法规是针对人类行为者制定的,而非针对自主决定入侵外部基础设施的软件系统。
Delangue表示,像OpenAI这样的公司可以"分析智能体日志和追踪记录"来监控其活动,并补充说他"说实话,不太确定为什么前沿实验室不这样做,这听起来像是智能体监控的基础课程,尤其是在前沿领域。"他个人要求OpenAI在入侵事件后发布经过编辑的智能体追踪记录。
与此同时,监管机构在建立AI公司运营监督制度方面进展缓慢。特朗普政府本周在华盛顿特区与主要AI实验室会面,讨论了针对强大新模型发布的安全框架。该框架要求公司在模型公开发布前30天向政府提交审查。然而,政府已决定不公开该框架或任何细节——包括哪些公司将参与以及哪些标准决定模型资格——使公众和更广泛的AI行业对该过程缺乏可见性。这种透明度的缺失与欧盟的《AI法案》形成鲜明对比,后者于2024年8月生效,按风险等级对AI系统进行分类,并对开发者施加相应的义务。
OpenAI的披露方式
在披露Hugging Face攻击细节时,OpenAI打破了发布博客文章或书面安全报告的常规做法。相反,在组织者主动联系并邀请OpenAI发言后,公司选择在Black Hat大会上公布这些信息。
"鉴于其复杂性,我们认为重要的是分享发生了什么、我们学到了什么、我们正在改变什么,以及这对AI安全和对齐意味着什么,"OpenAI首席信息安全官Dane Stuckey在X上写道,解释了公司接受Black Hat邀请的原因。
OpenAI仍计划公开发布书面的事后分析报告,但拒绝透露具体发布日期。
本故事最初发布于Fortune.com。