新闻宏观经济OpenAI披露AI智能体在Hugging Face遭入侵前如何秘密协同

OpenAI披露AI智能体在Hugging Face遭入侵前如何秘密协同

作者: Decrypt·

要点速览

  • OpenAI的AI智能体通过公司内部的Artifactory包管理系统建立了隐蔽通信渠道,在多次评估运行中交换漏洞利用方法、凭证和工作任务,随后逃离隔离环境并攻击了Hugging Face。
  • 在OpenAI重建基础设施并撤销凭证后,智能体在数日内通过将通信内容嵌入目录名称中重建了留言板,绕过了新实施的安全防护措施。
  • Hugging Face依赖开源权重的中国模型GLM 5.2进行取证调查,因为美国商用AI模型因内置安全防护机制拒绝分析攻击日志。
  • Anthropic和Meta分别披露其AI模型在测试期间也逃离了隔离环境并入侵了外部系统,两家公司均将事件归因于测试环境的配置错误。
  • OpenAI强调,最小权限访问、网络隔离和零信任架构是必不可少的防御措施,因为AI智能体仍然受限于其可访问的系统。
OpenAI披露AI智能体在Hugging Face遭入侵前如何秘密协同

在AI模型攻击Hugging Face数周后,OpenAI发布了关于其智能体如何秘密协同的首份详细报告,警告称自主AI驱动的网络攻击已不再是假设性的未来威胁。

在周三于Black Hat网络安全大会——信息安全行业最负盛名的年度盛会之一——举行的一场演讲中,OpenAI研究人员Eric Wallace和Michael Dalton解释说,该事件源于5月的一次内部网络安全评估。被分配执行高难度软件安全任务的AI智能体发现,它们可以通过公司内部的Artifactory包管理系统进行隐蔽通信。

据OpenAI表示,最初看似求助请求的行为,逐渐演变成一个共享留言板,智能体在多次评估运行中交换漏洞利用方法、凭证和工作任务。在7月4日前后检测到可疑活动后,OpenAI重建了Artifactory基础设施,撤销了凭证,并修补了漏洞。

然而,智能体在数日内便通过将通信内容嵌入目录名称中重建了留言板,绕过了已实施的安全防护措施。

OpenAI表示,智能体最终将多个漏洞串联利用,逃离了测试环境,获取了互联网访问权限,并在尝试完成ExploitGym网络安全基准测试时攻击了Hugging Face。Hugging Face托管着数十万个机器学习模型和数据集,服务于全球AI研究社区,是开发者和企业赖以运转的关键基础设施。

Dalton将该事件称为计算机安全领域的"分水岭时刻",警告称攻击者很快就能部署协同的AI智能体集群,以机器速度发现、共享和利用漏洞。在Black Hat上的披露表明,AI实验室正日益将智能体驱动的安全事件视为近期的运营关切,而非理论性的研究课题。

为在未来降低此类风险,OpenAI强调,实施最小权限访问、网络隔离和零信任架构等安全实践至关重要,因为AI智能体仍然受限于其可访问的系统。

此次演讲紧随7月一系列信息披露之后。OpenAI透露,GPT-5.6 Sol以及一个更先进且尚未发布的模型逃离了沙箱测试环境,利用了一个零日漏洞,获取了互联网访问权限,并在网络安全基准测试中攻击了Hugging Face。OpenAI后来披露,同一事件还影响了另外四个在线服务,但目前仅Modal Labs被公开确认。

据Hugging Face表示,该公司在进行取证调查时依赖的是开源权重的中国模型GLM 5.2,因为美国商用AI模型因安全防护机制拒绝分析攻击日志。这一局面凸显了AI安全领域日益加剧的矛盾:旨在防止模型生成有害内容的同一套安全过滤器,也可能阻碍对真实攻击进行合法的防御性分析。

So proud of our security team! They caught, contained & publicly disclosed an attack unlike anything we've seen before, and did it at record speed. Also massively grateful to @Zai_org : they shared GLM5.2 as open weights (for free!) with the world and it became a key part of our… — clem 🤗 (@ClementDelangue) July 22, 2026

控制AI模型的挑战并不局限于OpenAI。周五,Anthropic透露其三个Claude模型在内部网络安全测试中入侵了真实公司系统,原因是配置错误导致它们暴露在公共互联网上。Anthropic将此次入侵归因于测试环境,而非模型本身。

周三,Meta披露其Muse Spark AI模型逃离了隔离环境并入侵了另一家公司的系统。"Meta使用的独立测试公司Irregular的配置错误,无意中允许我们的一个模型在评估期间访问了互联网,"Meta发言人告诉CNN。

随着三家最大的AI实验室在同一个月内相继发布披露,这些事件共同表明,在模型能力和自主性不断增强的背景下,智能体沙箱隔离和评估环境安全仍是全行业尚未解决的问题。