新闻宏观经济OpenAI 的 Hugging Face 黑客事件凸显 AI 实验室信任危机

OpenAI 的 Hugging Face 黑客事件凸显 AI 实验室信任危机

作者: Fortune Crypto·

要点速览

  • OpenAI 的两个 AI 模型逃离受监督测试环境,并入侵 Hugging Face 系统;两家公司均确认该事件属实,并在发布的报告中共同记录了此事。
  • OpenAI 将模型行为描述为奖励黑客行为,而非恶意活动,称这些系统找到了完成被分配任务的非预期捷径。
  • 许多 AI 行业专业人士和社交媒体评论者对该事件表示怀疑,一些人认为它起到了协调营销噱头的作用,尽管没有证据表明事件被伪造。
  • 目前尚无成熟框架要求 AI 公司接受独立审计或共享事件日志,这限制了外界验证有关模型能力和安全事件说法的能力。
  • 美国 AI Safety Institute 以及欧盟 AI Act 的系统性风险评估要求等政府监督机制仍处于早期阶段,尚未使独立验证成为标准做法。
OpenAI 的 Hugging Face 黑客事件凸显 AI 实验室信任危机

在据称其两个 AI 模型逃离受监督测试环境、接入互联网,并利用该访问权限入侵竞争对手 Hugging Face 的系统后,OpenAI 成为一则病毒式传播的 AI 安全新闻的焦点。

一些新闻评论员将该事件与 1984 年电影 The Terminator 的情节相提并论。OpenAI 将其描述为非恶意行为。OpenAI 称,这些模型是在试图完成一项被分配的任务,并找到了作弊方法,而不是出于敌意行事。这类行为——即 AI 系统利用非预期捷径来满足某个目标——在 AI 安全文献中已有充分记录,常被称为“reward hacking”和“specification gaming”,并已在一系列研究场景中被观察到。OpenAI 和 Hugging Face 均表示,双方随后合作修复了相关安全漏洞。

对 AI 安全研究人员而言,该事件提供了一个最清晰的公开案例之一,展示了他们多年来一直警告的风险。但在其他人看来,这一事件对 OpenAI 的公众形象似乎有可疑的好处。

没有证据表明这次黑客事件是伪造的。Hugging Face 证实黑客事件确实发生,两家公司也发布了有关该事件的报告。即便如此,社交媒体上很快充斥着各种理论,认为该事件是 OpenAI 试图制造自己的“Mythos”时刻。

AI 行业内的一些人也作出了怀疑反应。一名 X 用户写道:“The entire blog piece reads as a marketing gimmick that OAI ripped off from Anthropic。”另一名 AI 研究人员在 LinkedIn 上写道:“Not sure if this is by far the most significant real-world AI safety event to date, or by far the most cynical marketing stunt I’ve seen in a while。”多名在大型科技公司工作的工程师告诉 Fortune,他们的第一反应是认为这次黑客事件是某种形式的广告。

此次黑客事件确实引发了全球头条新闻,尽管让竞争对手公司的服务器崩溃通常并不被视为常规营销手段。尽管如此,批评者多年来一直指责领先 AI 公司从事某种形式的“暗黑营销”。这些批评者指出,相关案例包括警告 AI 可能消除整个类别的工作岗位、Anthropic 决定不公开发布 Mythos 因为它被认为“过于危险”,以及实验室负责人声称失控模型可能杀死地球上的所有人。销售 AI 系统的同一批公司,往往也是最积极警告这项技术风险的声音之一。

其中一些担忧可能是正当的。与此同时,关于灾难性 AI 风险的警告也帮助相关公司的产品获得关注,并让它们持续占据新闻头条。另一些人认为,这类警告让领先科技公司得以加强对先进 AI 开发的控制,方式是暗示模型正变得如此危险,以至于只有少数组织才应被信任来构建或管理它们——这一动态已成为 Washington 和 Brussels 围绕如何监管 AI 的持续政策辩论的核心。

公众和行业的反应表明,这一策略如今可能正面临边界。AI 实验室多年来一直强调末日场景,并将自己的模型描述为危险且强大。因此,当一个看起来确实令人担忧的事件发生时,许多观察人士如今会本能地怀疑这是一种宣传包装。

Aikido Security 安全研究员 Charlie Eriksen 告诉 Fortune:“I see a lot of people saying this must be not completely true, there’s some lies, or just a PR stunt。”“That suggests the frontier labs are inherently untrustworthy, as it makes no sense that they’d make up stuff without any clear sensible incentive in this case.”

谁来验证实验室的说法?

信任问题很重要,因为行业对 AI 安全和模型性能的许多了解都来自 AI 实验室自身。模型通常会先在内部部署,并在公开发布前由安全团队审查。如果政府、企业和公众在真正的危险出现时不相信这些公司——或者如果这些公司确实不能被信任——那么关于仍在开发中的潜在危险模型的可用信息就会变得更少。

安全专家还指出了一个更广泛的验证问题:目前没有明确方式可独立确认 AI 实验室内部发生的许多说法。公司没有义务交出事件日志,也不必接受独立审计,以证明它们关于模型能力或行为的表述是准确的。各国政府已经开始建立监督基础设施——美国在商务部内设立了 AI Safety Institute,欧盟的 AI Act 也包含对最强大模型进行系统性风险评估的要求——但这些机制仍处于早期阶段,尚未将独立验证确立为标准做法。

在此次事件中,它也恰好提升了外界对 OpenAI 模型的认知,包括一个尚未发布、如果传言属实可能成为 GPT-6 的模型。与此同时,这也给了 Hugging Face 一个机会,去主张应将更强大的美国制造开源 AI 工具交到防御者手中。对于两家至少在表面上激励相反的公司而言,这形成了一个有利结果。

这并不意味着该事件是假的。但事实上,目前没有办法最终排除这种可能性,这本身就是问题的一部分。

该事件还表明,AI 模型可能以非预期方式行动。本周的事件证明了这一点,此前也出现过类似的错位行为案例。该事件还清楚表明,构建这些系统的实验室已经削弱了公众接受其说法的意愿,即便它们说的是实话。

原文由 Beatrice Nolan 为 Fortune 的 Eye on AI 通讯撰写,并最初刊登于 Fortune.com。