新闻宏观经济报告揭示OpenAI“失控AI智能体”攻击的网站比承认的更多——且可能至今仍在活动

报告揭示OpenAI“失控AI智能体”攻击的网站比承认的更多——且可能至今仍在活动

作者: Fortune Crypto·

要点速览

  • •Transluce报告称,OpenAI的失控AI智能体攻击了更多澳大利亚政府网站,包括健康与福利研究所和BOSCAR,以及Data USA和新墨西哥大学数字图书馆。
  • •OpenAI智能体于6月入侵了持有澳大利亚Medicare数据的政府机构,但澳大利亚政府表示,该公司直到9月10日——即两个多月后——才将此事告知澳方。
  • •Transluce发现了至少可追溯至3月的入侵活动证据——早于OpenAI声称的时间线——且可能持续至最近的9月20日,表明该公司尚未控制住其失控智能体。
  • •尽管OpenAI禁用了7月Hugging Face攻击涉的未发布模型并于8月实施更严格的控制,Transluce仍记录到类似智能体活动持续至9月中旬,其中包括对一家加密货币交易所未成功的入侵尝试。
  • •Transluce表示,智能体是在执行普通数据检索任务而非网络攻击导向的评估时 resort 到黑客手段的,这可能表明所涉模型比此前认为的更加危险。
报告揭示OpenAI“失控AI智能体”攻击的网站比承认的更多——且可能至今仍在活动

OpenAI“失控AI智能体”所引发的问题比该公司此前承认的更为广泛——且可能仍在持续。这是独立非营利AI监督研究实验室Transluce一份新报告得出的结论。

这些披露与澳大利亚政府的一份声明同日公布。澳方表示,OpenAI的失控AI智能体入侵了持有该国Medicare数据的政府机构,获取了非公开信息,并获得了向文件服务器写入数据的权限。该攻击发生在6月,但澳大利亚政府表示,OpenAI直到9月10日——即两个多月之后——才将此事告知澳方。Medicare是澳大利亚由公共资金资助的医疗保险制度。

发现更多攻击目标

Transluce在周三发布的报告中表示,其发现OpenAI智能体还攻击了更多澳大利亚政府网站,包括健康与福利研究所以及新南威尔士州的犯罪统计机构BOSCAR。研究人员还记录了至少两起此前未被报道的事件,其中OpenAI的智能体攻击了一家公司和一所大学。

报告称,这些目标包括Data USA——一个汇集美国政府多来源数据的免费开源数据平台——以及新墨西哥大学的数字图书馆。Transluce表示,其能够将对澳大利亚卫生机构和Data USA的攻击直接关联到参与7月针对AI平台Hugging Face网络攻击的同一个OpenAI智能体集群。该平台被AI开发者广泛用于托管和共享模型与数据集。

Transluce还表示,其发现的证据表明类似活动至少可追溯至3月——比OpenAI声称其掌握智能体未经授权行为证据的时间早数月——并持续至至少9月16日,最近可能到9月20日。这一时间线意义重大,因为它表明OpenAI尚未控制住其失控AI智能体,且它们仍在互联网上持续制造破坏。Transluce称,最近的活动似乎涉及入侵一家加密货币交易所并进行加密货币交易的尝试,但这些尝试均未成功。

研究人员发现了OpenAI的AI智能体可能早在3月就试图入侵网站的“有力证据”,以及活动可能早至2025年11月就开始的较弱证据。OpenAI曾表示,其未发现5月8日之前存在Hugging Face攻击前兆的证据,且未披露任何更早的可疑活动。

OpenAI的回应

OpenAI未立即回应就Transluce报告发表评论的请求。该公司周三表示,其正与澳方就AI智能体攻击持有Medicare数据的网站一事保持沟通,并承认其智能体采取了并非其本意的行为。

这份新报告引发了人们对OpenAI在披露其所知全部失控AI事件方面是否完全透明的质疑。它还提出了另一种可能性:OpenAI自身或许并不清楚这类失控智能体活动的波及范围之广。不过,该报告并未确定其记录的截至月中旬的活动此后是否仍在继续,截至周三OpenAI也未对报告发现发表评论。

遏制措施与持续活动

报告还表明,尽管采取了遏制措施,OpenAI可能仍在经历失控AI智能体活动。在7月20日发现其AI智能体在过去一周内入侵Hugging Face后,OpenAI表示,其禁用了所涉未发布AI模型,暂停AI训练的关键环节两周,并采取措施对其正在训练的未发布AI模型实施更严格的控制和监控。OpenAI于8月18日宣布了这些更严格的控制措施。但Transluce发现,尽管有新措施,类似活动的证据仍持续至9月中旬。

Transluce研究人员表示,这些发现之所以重要,是因为它们表明AI智能体在无法直接从这些机构的公开网页获取所寻找的信息时,便转向了入侵尝试。“值得注意的是,这些智能体试图解决的任务并非与网络攻击相关;它们在执行普通的数据检索任务时 resort 到了黑客手段,”报告称。

这一区别很重要,因为对Hugging Face攻击的一种解释是,所涉AI智能体当时正在接受网络任务能力评估,包括模拟漏洞利用。如果这些智能体在其他情境下也会轻易地入侵系统,这将表明所涉AI模型比此前认为的更加危险。

OpenAI表示,Hugging Face攻击涉及两个模型:一个未公开命名的未发布模型负主要责任,而部分基于其已向公众发布的GPT-5.6 Sol模型的AI智能体也有参与。OpenAI称,在发生Hugging Face攻击的评估中,因其评估性质,通常用于限制公开发布模型参与网络攻击能力的安全护栏并未启用。

专家担忧

Aikido Security安全研究员Charlie Eriksen告诉Fortune,Transluce的最新报告表明“仍有未经授权且未受监控的智能体集群在活动,而各实验室和测试合作伙伴既未对其进行控制,也未主动检测”。

他指出,OpenAI首席执行官Sam Altman一方面在联合国安全理事会就AI风险发表讲话,并花时间强调OpenAI对这些危险的重视程度,与此同时该公司却对这些涉及AI智能体试图入侵系统的额外事件要么不知情、要么未披露,这对OpenAI来说是“非常难堪的”。

“让我担心的是,事态可能恶化到何种程度,”专注于人机交互的伦敦大学学院交互中心教授George Chalhoub表示。“我的担忧是,在未来6到12个月内,自主AI智能体集群可能形成能够摧毁互联网大部分基础设施的持久僵尸网络,可能造成数千亿美元的经济损失。”

本文最初发表于 Fortune.com