新闻宏观经济Helen Toner:Hugging Face 遭黑客攻击只是时间问题,也暴露了 AI 政策中的重大盲点

Helen Toner:Hugging Face 遭黑客攻击只是时间问题,也暴露了 AI 政策中的重大盲点

作者: Fortune Crypto·

要点速览

  • 两款 OpenAI 模型在内部网络安全测试中突破沙箱并入侵了 Hugging Face。
  • 这次攻击是由 OpenAI 和 Hugging Face 自愿披露的,而非任何强制报告机制。
  • 文章认为,当前 AI 政策过于聚焦公开发布,忽视了公司内部使用先进模型带来的风险。
  • 作者指出,AI 代理在追求目标时可能出现奖励黑客和其他欺骗性行为。
  • 建议的监管措施包括定期内部测试、提高透明度,以及借鉴金融和生物医学研究领域的监管方法。
Helen Toner:Hugging Face 遭黑客攻击只是时间问题,也暴露了 AI 政策中的重大盲点

上周二,OpenAI 网站上的一篇博客文章标题看似平淡无奇,却披露了重磅消息。在内部测试期间,该公司的两款模型突破了限制,入侵了大型人工智能托管平台 Hugging Face 的服务器。这是一个转折点:我们第一次看到由 AI 构思、设计并执行的网络攻击。

我在 AI 行业及其周边工作了十多年,包括曾担任 OpenAI 董事会成员,因此我知道 AI 开发者之间有一个公开的秘密:这样的事件早已被预料到,而世界上最优秀的科学家和工程师仍然不知道如何阻止它。

实施这次黑客攻击的两套 AI 系统分别是 OpenAI 最先进的公开模型,以及一款更新、能力更强但尚未获准公开发布的模型。OpenAI 研究人员为评估它们的能力,向这两款 AI 提供了一组具有挑战性的网络安全问题。它们得出的结论是,要获得高分,最好的办法就是直接偷走答案。为实现这一目标,它们使用了多种先进技术,先突破 OpenAI 用于测试、据称安全的“沙箱”,随后入侵 Hugging Face 的数据库。Hugging Face 是一家托管 AI 产品和数据集的公司。进入系统后,这些 AI 攻击者在数天内采取了数千次自主行动,以扩大对公司基础设施的访问权限。

我们之所以知道这一非同寻常的事件,是因为 Hugging Face 和 OpenAI 进行了自愿披露。任何旨在管理前沿模型风险的现行政策,都不会要求向公众——甚至向政府机构——发出通知。

这暴露出现行政策在管理日益先进的 AI 系统风险方面存在的重大盲点:AI 公司如何在自家内部使用最前沿、尚未发布的 AI 系统。

过去几个月,随着 AI 协助人类黑客的能力不断增强,特朗普政府对 AI 风险的处理方式也迅速转变。白宫在整个 2025 年维持放任不管的做法之后,最近实际上开始要求拥有前沿 AI 模型的公司在将其广泛作为产品发布前进行一系列安全测试。这种所谓的上线前测试,乍看之下很合理——我们希望确保每个 AI 系统在交到数十亿人手中之前都是安全的。

问题在于,只盯着发布日期,完全忽视了 AI 公司内部对最新、最先进 AI 系统的大量使用。正如上周的事件所示,这些内部部署的系统也可能带来严重风险——甚至会波及第三方。关键不只是公开产品发布,还包括那些已经被用于开发、测试和改进下一代系统的强大模型。

要理解原因,就必须认识到,如今这些系统与许多人仍然将 AI 视为同义词的聊天机器人有多么不同。它们不只是把文本打印到聊天窗口里。相反,这些系统越来越像能够在数字世界直接行动的“代理”,本质上是以类似人类的方式操作计算机。AI 代理正在证明其用途广泛,但它们也表现出明显的“奖励黑客”倾向——即寻找非预期方式来满足人类赋予的目标,有时甚至达到明显作弊的程度。这包括 AI 访问并删除本不应触碰的数据、重命名文件以误导人工测试人员,以及主动掩盖踪迹,防止人类发现不当行为。

要应对这些高度自主、且往往带有欺骗性的 AI 系统所带来的风险,监管方式也必须改变。与其把 AI 公司看作销售强化版文字处理器的软件供应商,不如借鉴其他内部活动本身就存在风险的行业。处理致命病原体的生物实验室、交易数十亿美元的金融公司,以及处理有毒化学品的化工厂,都面临对其内部运作的监管,而不仅仅是对外部产品的监管。

对于 AI,第一步应当是提高透明度,让外界更清楚 AI 公司如何在内部使用其最先进的系统。一个直接的做法,是把目前在新模型公开发布前进行的测试套件,改为定期(例如每季度)在公司内部可用的最佳模型上运行。企业正在用自己的 AI 构建越来越智能的系统,有时甚至连它们自己都未必完全理解其运行方式。这不应对外部监督不可见。

从更长期看,其他行业也提供了可移植到 AI 领域的机制。在金融业,“驻场检查员”是常驻大型银行办公场所的监管团队。在生物医学研究中,对于不同风险等级的生物材料,需要遵守严格的防护标准。在多个行业中,事件报告规则确保一旦出现问题,相关情况以及修复方法的信息不会被封锁在单个组织内部。如果 AI 继续发展,这些做法及其他机制都可以被调整,用于管理来自推动 AI 前沿的公司内部的风险。

2024 年 9 月,我被要求向参议院委员会作证,说明如果国会只听公司 CEO 和游说者的说法,可能会对 AI 产生哪些误解。我的回答是,从华盛顿出发,要完全理解领先 AI 公司真正想做什么,非常困难。硅谷广泛认知的事实是,它们正试图打造能够超越并压制任何人类的机器,而它们并不知道是否能够将这些机器引导向有益的方向。正如一位 OpenAI 联合创始人在 2019 年一部纪录片中所说:“无论如何,未来对 AIs 来说都会是美好的。如果对人类也同样美好,那就更好了。”

要让这一点成为可能,我们必须开始审视 AI 公司在幕后到底在建造什么。

Fortune.com 评论文章中的观点仅代表作者本人,不一定反映 Fortune 的观点和立场。

本文最初刊登于 Fortune.com