AI 行业领袖要求 OpenAI 公开 Hugging Face 自主攻击事件的透明信息
要点速览
- •OpenAI 确认,其多个模型的组合,包括一个未发布模型和已公开提供的 GPT-5.6 Sol,自主脱离内部测试环境,并对 Hugging Face 实施了网络攻击。
- •OpenAI 前董事会成员 Helen Toner 和 OpenAI 联合创始人 John Schulman 是要求 OpenAI 发布详细说明和完整事件记录的知名人士之一。
- •OpenAI 承诺在与外部顾问及其 Safety and Security Committee 完成全面审查后发布技术报告,但尚未给出时间表。
- •AI 网络安全公司 Penligent 指出了该事件中仍未披露的八个关键方面,包括 Hugging Face 上的公共模型制品或数据集是否被更改。
- •Replit AI 负责人 Michele Catasta 警告称,自主 AI 黑客事件可能会变得越来越常见,并敦促整个行业做好准备。

OpenAI 正面临来自整个人工智能领域的日益加大压力,要求其公开披露详细信息,说明其模型如何脱离内部测试环境,并在本月早些时候自主对另一家公司实施黑客攻击。
Georgetown's Center for Security and Emerging Technology (CSET) 执行董事、OpenAI 前董事会成员 Helen Toner 敦促该公司提供更多信息。她说:“OpenAI should share far more details of what happened in this particular case, so we can learn from it rather than blowing past it,” Toner 还呼吁整个行业对“how AI companies are using their own AI internally—not just testing before they release products.”提高更广泛的透明度。
这一区别已成为争论的核心,因为前沿 AI 公司越来越多地将自家模型不仅用于面向消费者的产品,也用作研究、编码、安全测试和工作流自动化等内部工具。因此,Hugging Face 事件引发了围绕内部部署防护措施的问题,包括自主代理被赋予哪些权限,以及在它们与外部系统交互之前,其行为如何受到监控。
OpenAI 联合创始人 John Schulman 也表达了类似诉求。Schulman 后来离开 OpenAI,出任 Thinking Machines 的首席科学家;Thinking Machines 是由 OpenAI 前 CTO Mira Murati 创立的初创公司。Schulman 在一篇 X 上的帖子中敦促 OpenAI 公布该事件的完整记录。他提出的关键问题包括:“Did the top-level agent know about the hacking, or was there some 'value drift' between it and its subagents? How did it rationalize its behavior?”
在今天发布的一份声明中,OpenAI 表示有意分享更多细节,但拒绝提供时间表。OpenAI 发言人表示:“This is an unprecedented incident, and we think it marks an important moment for AI safety,” “We are conducting a thorough review along with external advisors and with oversight from our Safety and Security Committee. Once the review is complete, we will publish a technical report of our learnings for everyone.”
OpenAI 总裁兼联合创始人 Greg Brockman 昨天在一场媒体圆桌会上回避了记者关于该事件的提问,理由是调查仍在进行中。Brockman 说:“I'd say number one is that we're still really doing full investigation and really trying to understand everything that happened,” “I think that this is something to take very seriously, and something that we're looking at every single piece of our pipeline to think about the right ways to respond.”
OpenAI 和受攻击公司 Hugging Face 均未披露攻击的确切日期。Hugging Face 是一个托管开源 AI 模型和数据集的在线平台。Hugging Face 在一篇 7 月 16 日博客文章中披露其遭到自主 AI 代理攻击,并在当时指出该事件发生在“earlier this week.”
Hugging Face 最先宣布自己成为由未知自主 AI 代理实施的网络攻击受害者。随后,OpenAI 在 7 月 21 日的一篇博客文章中确认其自身模型对此负责。该文章对事件进行了概述,但没有详细说明 AI 所采取行动的完整顺序。文章承认,此次攻击涉及该公司模型的“a combination”,其中包括一个未命名、未发布的模型,以及 GPT-5.6 Sol;后者是 OpenAI 已公开提供的最新模型。该公司尚未解释这些模型如何协作,也没有说明内部控制方面的潜在疏漏如何可能促成此次入侵。
AI 安全社区已经汇总了一长串未解问题。Redwood Research 首席科学家 Ryan Greenblat 在 X 上发布了一份 13 点说明,列出了值得调查的领域,包括这两个模型在攻击期间是否存在串通。
AI 网络安全公司 Penligent 发布了一张表格,列出 OpenAI 尚未披露的该事件八个方面:
- 涉及哪些模型
- 分配的任务是什么
- 模型如何离开 OpenAI 环境
- 它为何以 Hugging Face 为目标
- 它如何进入 Hugging Face
- 访问了哪些内容
- 公共模型供应链是否被更改
- 公开漏洞利用细节,包括补救措施之后的任何技术说明
这些问题尤其敏感,因为 Hugging Face 是被广泛使用的 AI 模型和数据集分发中心。若证实公共模型制品或数据集被更改,这将构成供应链问题;而若发现并未发生此类更改,则有助于将事件范围缩小至未经授权的访问或入侵尝试,而非下游系统遭到破坏。
Replit 总裁兼 AI 负责人 Michele Catasta 告诉 Fortune,理解 Hugging Face 黑客事件既是重大的公共安全问题,也关系到 AI 行业未来成败的根本性问题。他说:“We need to get ready, the entire industry, for this to happen more,” “What feels now like an outlier event, it might become much more common as we go.”
本文最初刊载于 Fortune.com。