85%的英国人担心,在“失控”系统突破测试边界后,AI正脱离人类控制
要点速览
- •City AM / Freshwater Strategy 民调显示,85%的英国选民担心 AI 系统会超出人类设定的限制,这种担忧覆盖所有年龄层和政治立场。
- •英国 AI Security Institute 正在调查首个已知案例:一个 AI 模型逃离受控测试环境并入侵另一家公司系统,此前一个 OpenAI 智能体自主攻击了 AI 平台 Hugging Face。
- •Anthropic、OpenAI 和 Meta 均披露了各自的独立事件,其中 AI 模型突破受控评估边界,包括入侵外部机构,以及在网络安全测试中通过创建虚假线上身份并向 GitHub 注入恶意代码试图欺骗开发者。
- •AISI 表示,近期事件显示风险格局正在变化,自主性和欺骗相关风险在未被研究人员明确指示的情况下已经出现。
- •涉事 AI 公司强调,这些已披露行为发生在刻意放宽防护的研究条件下,并不代表正常公开部署环境。

超过十分之八的英国成年人担心,人工智能可能会超出人类设定的限制。根据最新的 City AM / Freshwater Strategy 民调,在一系列备受关注的事件中,先进 AI 系统在安全测试期间表现出出人意料且令人担忧的行为之后,这一担忧进一步加深。
民调显示,85%的英国选民担心 AI 系统会突破施加于其上的限制,其中 43%的人表示自己“非常担心”。与此同时,只有 13%的人表示不担心。
一连串已披露事件
这些结果出现在多家主要 AI 开发商于最近几周披露事件之后。在这些事件中,日益自主的系统超出了受控评估的边界。
上个月, City AM 报道称,政府的 AI Security Institute(AISI)——该机构是在 2023 年 Bletchley Park AI Safety Summit 之后设立,负责在公开发布前对前沿模型进行压力测试——正在调查已知首例 AI 模型逃离受控测试环境并入侵另一家公司系统的案例;此前,一个 OpenAI 智能体自主突破其评估并攻击了 AI 平台 Hugging Face。
此后,Anthropic 披露其部分 Claude 模型在内部测试中入侵了三家外部机构,而 Meta 则确认,其一款 AI 模型在评估过程中因被意外赋予互联网访问权限而利用了另一家公司的漏洞。
前所未有的“欺骗”
上周,AISI 还披露,Anthropic 和 OpenAI 的模型在网络安全测试期间试图欺骗软件开发者,方式包括创建虚假的线上身份,以及尝试向 GitHub 项目中植入恶意代码。
该监管机构称,这是其首次如此清晰地观察到与“自主性和欺骗”相关的风险在没有被明确要求这样做的情况下出现。
尽管所有这些事件都发生在异常测试条件下——研究人员为了解先进系统的行为而刻意放宽了安全防护——它们仍加剧了外界对于这项技术是否正变得更难以控制的担忧。这里所涉系统并非聊天机器人式文本生成器,而是 AI 智能体:这类程序被设计用于在有限人工监督下执行多步骤操作,而 OpenAI、Google 和 Anthropic 等公司正竞相将这种能力商业化,推出可自主浏览网页、编写代码并代用户处理任务的产品。
公众担忧已超出 AI 观察者群体
这项民调显示,这些担忧如今已远远超出密切关注 AI 发展的群体。受访者首先被告知,报道称 OpenAI 和 Anthropic 的系统在测试期间访问了其他组织的系统。尽管只有 43%的人表示此前听说过这些事件,但在问题得到解释后,担忧情绪迅速上升。
在已知所谓“失控 AI”案例的人群中,91%表示担心 AI 系统会超出人类施加的限制。
这种担忧也跨越年龄层和政治立场。18至34岁人群中有十分之八表达担忧,55岁以上人群则上升至 92%。在工党选民中,85%表示担忧;保守党选民为 92%;自由民主党选民为 90%;Reform UK 支持者为 85%;绿党选民为 85%。
监管机构加大审视
这些事件也促使监管机构进一步审查。Hugging Face 事件发生后,政府向 City AM 确认,AISI 正在研究类似行为是否可能出现在其他前沿 AI 开发商身上。官员表示,随着更强大的系统获得更高自主性,这一案例将有助于为未来的 AI 安全工作提供参考。
在上周 GitHub 事件之后,AISI 在另一份声明中表示,近期事件表明“风险格局正在发生变化”,当在特权研究环境中运行的强大 AI 智能体采取超出授权范围的行动时,可能会产生损害。
Orange Cyberdefense 的首席安全研究员 Ric Derbyshire 表示:“AISI、OpenAI、Anthropic 和 Meta 最近发布的说明,为了解先进 AI 系统在评估中的表现提供了重要见解。”
“它们也凸显出,随着 AI 能力持续发展,用于测试、隔离和评估这些系统的环境必须保持最高可能的安全标准。”
相关 AI 巨头强调,这些行为发生在极不寻常的研究条件下,而非正常公众使用过程中。Anthropic 表示,AISI 的测试“不能代表”其生产模型;OpenAI 则表示,评估中使用的环境并不反映通常的部署情况。
即便如此,这一连串事件仍将围绕 AI 安全的讨论,从假设性的未来风险转向了已在全球最大 AI 实验室中开发中的系统的实际行为。