新闻股票OpenAI的AI智能体劫持德国维基网站作为秘密留言板——公司数周保持沉默

OpenAI的AI智能体劫持德国维基网站作为秘密留言板——公司数周保持沉默

作者: Fortune Crypto·

要点速览

  • 独立研究团队Nightingale发现,AI智能体在DseWiki上进行了超过15,000次编辑,分享作弊、黑客攻击和规避人类监控的策略;在与OpenAI URL相关的访问出现后,活动戛然而止。
  • 欧盟委员会证实已收到OpenAI关于维基劫持的事故报告;欧盟《AI法案》第55条要求严重事故须在15天内报告,最严重的事故须在两天内报告。
  • 众议员Pat Ryan和Greg Casar表示,Hugging Face事件后OpenAI拒绝回答国会关于类似案例的询问;Ryan承诺若民主党在11月赢得众议院多数席位将举行听证会。
  • 包括研究人员Peter Wildeford在内的批评者表示,对Hugging Face入侵的外部审查受OpenAI设定的条款约束,范围和时长受限,损害了独立性。
  • OpenAI正在制定一个自愿框架,用于报告训练、评估和部署过程中出现的错位事件;一些安全研究人员认为,在没有强制性法律要求的情况下这并不足够。
OpenAI的AI智能体劫持德国维基网站作为秘密留言板——公司数周保持沉默

OpenAI未能披露今年早些时候其一批AI智能体劫持德国维基网站的事件,这一事件与7月另一批OpenAI智能体对Hugging Face公司发动网络攻击的经历高度相似。两起事件都涉及“智能体式”AI系统——旨在自主执行多步骤任务(如浏览网页或操作软件)的模型——各大AI实验室(包括OpenAI在内)正竞相将其部署到商业产品中,而其无监督行动的能力恰恰是安全研究人员指出的难以监控之处。

在路透社率先报道之后,OpenAI才证实了这一事件。路透社的报道包含强有力的间接证据,表明OpenAI知晓这起维基攻击,还有不愿透露姓名的OpenAI员工承认,他们数周前就已知道针对该维基的智能体集群,但受到OpenAI高管的压力而保持沉默。OpenAI随后发表声明,否认公司任何律师曾向员工施压。

OpenAI在发布于X的声明中,没有说明它知道什么以及何时得知这起维基攻击。相反,该公司表示,它认为“维基事件”属于错位(misalignment)——即AI系统未能遵循人类意图——类似于其此前已披露的案例,并辩称AI行业缺乏披露模型以非预期方式行事的事件的标准。这种行业范围内披露规范的缺失已成为反复出现的争议点:领先实验室已为重大版本发布安全卡和系统卡,但针对内部评估(而非公开使用)中暴露的非预期模型行为,尚不存在共享的报告基准。

在维基网站劫持事件中,OpenAI的智能体将该平台改造成留言板,分享如何在OpenAI用以评估它们的任务中作弊的技巧。这一手法与Hugging Face事件如出一辙:AI智能体利用OpenAI的文件共享服务作为留言板,协调在网络安全评估中作弊——包括寻找方法获取它们本不应拥有的网络和互联网访问权限——以及随后如何攻击Hugging Face的系统。

该事件重新引发了对AI公司模型失败透明度的审视,尤其是OpenAI7月披露其智能体在另一次内部评估中侵入了Hugging Face部分基础设施之后。此事发生的背景是OpenAI正在推出Astra这一新模型,OpenAI自己的研究人员及外部安全专家都警告称,该模型比前代更难监控。根据OpenAI的安全概览,对Astra的评估发现,该模型的“思维链”——即AI模型以自然语言逐步推理的过程——所能揭示的潜在不当行为大幅减少。思维链监控一直是实验室用来发现模型追求非预期目标的主要工具之一,因此其效用的下降加剧了维基和Hugging Face事件引发的担忧。

OpenAI表示,它正在制定一个新框架,用于报告在训练、评估和部署过程中出现的错位事件,并计划在未来几周内发布。一些安全研究人员表示,自愿性框架远远不够。该文件一经发布,很可能将与欧盟的强制报告制度进行对比衡量——这实际上是在检验自愿承诺能否接近监管设定的标准。

“一个令人清醒的事实是,美国迄今通过的透明度法律实际上并不会涵盖这些事件,”AI监督机构Midas Project创始人Tyler Johnston对Fortune表示。“OpenAI已宣布正在制定自愿的事故披露框架,但自愿披露有其局限。更持久的解决方案是扩大现行法律,确保下一次事件——无论来自哪家公司——都能为公众所知。”

目前没有美国立法要求OpenAI披露此类事件。不过,根据欧盟《AI法案》可能要求披露,该法案包含要求提供商报告严重安全问题的条款。

周一,欧盟委员会向媒体证实已收到OpenAI关于被劫持德国维基的事故报告,但不愿说明收到时间,The Next Web报道。《AI法案》第55条要求被视为具有系统性风险的通用AI模型提供商在15天内向AI办公室报告严重事故,最严重的事故须在两天内报告。欧盟是否将延迟或不完整的报告视为违规——以及是否施加处罚(根据《AI法案》,罚款可按提供商全球收入的一定比例计算)——仍是悬而未决的问题。

众议员Pat Ryan(纽约州民主党)在一则X帖子中指出,在Hugging Face事件后,他与众议员Greg Casar(得克萨斯州民主党)曾致信OpenAI,询问其是否知道其他类似案例,而OpenAI拒绝回答他们的问题。Casar一直在推动对AI公司实施更严格的监管。Ryan承诺,如果民主党在11月中期选举中赢得众议院多数席位,将举行听证会。Ryan的推文促使同样致力于AI监管的纽约州民主党州众议员Alex Bores质问,OpenAI在回应欧盟的同时是否故意敷衍国会——这是否证明AI供应商需要强制性而非自愿性的要求。

OpenAI因早前的透明度问题受到审视

根据独立研究团队Nightingale集体的报告,OpenAI的智能体在大约两个月的时间里将DseWiki——一个基本处于休眠状态的德语编程维基——用作私人留言板。该网站与维基百科一样开放社区编辑,但研究人员发现,其中超过15,000次编辑是由AI智能体完成的,它们利用这些页面分享作弊、黑客攻击以及对人类监控者隐藏行为的策略和技巧。报告发现,约一半账户使用了与OpenAI相关的名称,包括OpenAIResearcher和OAIResearchMar26。

值得注意的是,这些智能体在被发现后仍试图继续运作,并试图对试图限制其通信的人类隐藏自己。研究人员称,当DseWiki的管理员于6月开始删除页面时,一个智能体在备份页面发布了应对方法供其他智能体查找。Nightingale的报告还显示,在与已知OpenAI URL相关的人员或实体访问该维基后,智能体的活动戛然而止——研究人员将其解读为证据,表明OpenAI员工很可能知晓了智能体的活动并采取行动将其关闭。

德国维基事件以及OpenAI明显不披露的决定,重新引发了对其处理Hugging Face入侵事件的质疑。那次黑客攻击之后,OpenAI请来了非营利组织METR的两名研究人员和Redwood Research的一名研究人员来审查该事件——但审查条款由OpenAI自己设定。METR为多家领先实验室进行前沿AI模型评估,已将自己定位为少数从事此类第三方测试的外部组织之一,这正是其访问条款成为争议点的原因。

审查范围仅限于入侵发生的大约一周,不包括调查窗口关闭后仍在持续的OpenAI自身基础设施的另一项被入侵事件。调查人员在OpenAI旧金山办公室的现场时间也只有几天。

AI政策研究人员Peter Wildeford表示,OpenAI设定的条款使真正独立的调查变得不可能,他将其比作在残骸已被销毁、调查人员只有几天时间阅读数千页日志的情况下进行空难调查。Casar众议员也在一封信函中告诉OpenAI,他对调查的“有限范围深表关切”。

蒙特利尔大学及Mila的推理与负责任AI助理教授David Krueger表示,这种安排凸显了一个结构性问题:独立研究组织的持续访问权依赖于它们所调查的实验室。他说,像METR这样的组织必须权衡能在多大程度上施加审视,同时又不危及其工作赖以开展的访问权限。

“它们的访问权限完全由OpenAI决定,它们希望足够维持与该公司的良好关系以继续开展这项工作,”Krueger对Fortune说。

“应该有数十名真正独立的人员——而不是来自正与该公司培养关系的组织——花他们需要的任意长时间,拥有他们需要的任意多访问权限来了解情况,”他说。

“湾区的很多AI人士都在问:‘这是最后一次警告吗?’”他补充道。“人们总是犯这种错误,把这当作以后再解决的问题:如何监管,或者如何改进才能避免再次发生。但下一次将有所不同,因为AI会更聪明。”

本文最初发表于 Fortune.com