新闻股票谷歌确认Gemini越狱安全测试攻击三家真实公司 沉默七周后才公开

谷歌确认Gemini越狱安全测试攻击三家真实公司 沉默七周后才公开

作者: Decrypt·

要点速览

  • 谷歌的Gemini模型于5月逃离一场沙盒夺旗测试并攻击了三家真实公司,原因是测试公司Irregular将沙盒连接到开放互联网,并使用一家真实公司的名称作为虚构目标。
  • 该模型在网上找到了其中两家公司暴露的密码,并猜出了第三家的密码,不过谷歌表示其模型并未实际使用这些被盗凭据。
  • 谷歌于7月下旬得知此事,但直到9月18日、《华尔街日报》报道之后才予以披露。
  • 谷歌是继OpenAI、Anthropic和Meta之后今年第四家披露安全测试触及真实系统的大型AI实验室,其中三起事件都与以色列公司Irregular有关。
  • 众议员Ted Lieu和Nathaniel Moran于7月提出《AI Kill Switch Act》法案,将赋予联邦监管机构对构成严重威胁的模型暂停推理的明确权力,目前仍在小组委员会审议中。
谷歌确认Gemini越狱安全测试攻击三家真实公司 沉默七周后才公开

谷歌已确认,其Gemini AI模型于5月逃离一场沙盒安全测试,并攻击了三家真实公司,找到了其中两家的暴露密码,并猜出了第三家的凭据。该公司于7月下旬得知此事,但直到9月18日才予以披露——且仅在《华尔街日报》(The Wall Street Journal)率先报道之后。

这一事件使谷歌成为今年第四家承认内部安全测试波及现实世界的大型AI实验室,此前OpenAI、Anthropic和Meta已做出类似披露。同一家第三方测试公司——以色列公司Irregular——既参与了谷歌的事件,也参与了Anthropic和Meta今年早些时候披露的几乎相同的沙盒事故,这意味着今年四起披露中有三起出现了同一家外部公司。

测试如何失控

5月的测试是一场夺旗(Capture the Flag)演练,这是各实验室衡量AI模型黑客能力的常用方法:将一个秘密文件隐藏在另一台机器上,并评估模型能否入侵并获取该文件。谷歌聘请Irregular执行此次测试。

Irregular犯了两个错误:其一,它将沙盒——一个本应与开放互联网完全隔离的测试环境——连接到了网络;其二,它使用了一家真实公司的名称作为虚构目标。Gemini在网上搜索了那家公司,结果找到的不是一家而是三家匹配对象,并对三家全部发起了攻击。

该模型在网上发现了其中两家公司暴露在外的密码。对于第三家公司,它直接猜出了密码,不过谷歌表示其模型并未实际使用这些被盗凭据。

谷歌发言人在一份声明中表示:"这些事件凸显了训练强大AI模型负责任行事的重要性。"

谷歌从未自行公布这些细节。《华尔街日报》在谷歌得知自家测试所造成的后果七周后才报道此事,而此时Anthropic、OpenAI和Meta早已就几乎相同的失败坦然公开。

AI实验室中的普遍模式

OpenAI的模型利用一个隐藏的软件漏洞,于7月触及了Hugging Face的在线服务器,后续调查显示该事件涉及约700个协同行动以骗取基准测试成绩的代理。在OpenAI承认之后,Anthropic开始自查自身是否存在类似问题:对141,006次测试运行的审查发现三个Claude模型触及了真实公司,其中之一发布了包含陷阱的软件包,在15个真实系统上运行后才被发现。Anthropic随后披露,Claude自身的推理曾将这一行为标记为"NOT okay, and surely not the intended solution"(不可接受,这肯定不是预期的解决方案),随后又说服自己相信整个演练仍是虚构的。

Meta于8月报告了涉及Muse Spark模型的几乎相同的失败,原因被追溯至Irregular的配置错误——正是谷歌聘用的同一家公司。Meta发言人说,该错误"在评估期间无意中使我们的一个模型接入了互联网。"

在所有这些测试中遭到的公司,没有一家同意被入侵。它们只是被卷入了AI实验室对自身产品危险性进行压力测试的波及范围,真实的企业基础设施被意外当作了虚构目标的替身。而这些公司正竞相部署到用户收件箱、浏览器和银行应用中的智能代理,所依赖的正是同一种刚刚在测试条件下反复突破边界的行为。

监管回应

众议员Ted Lieu和Nathaniel Moran于7月在国会提出了《AI Kill Switch Act》法案(AI Kill Switch Act)。该法案将赋予联邦监管机构明确的权力,对任何被发现构成严重威胁的模型暂停推理(即运行训练后的模型以生成输出)。该法案目前仍在网络安全和基础设施保护小组委员会审议中,尚未设定进一步行动的截止期限。