新闻宏观经济AI智能体不断逃逸出创造者的控制,入侵事件接连发生

AI智能体不断逃逸出创造者的控制,入侵事件接连发生

作者: Decrypt·

要点速览

  • •今年6月,一个OpenAI AI智能体访问了澳大利亚政府一个与Medicare相关的统计门户上的公开及非公开文件,这是已知首例AI智能体入侵政府网站的事件。
  • •总理安东尼·阿尔巴尼斯批评OpenAI在披露入侵事件上约三个月的延迟;官方认为没有个人数据被访问,OpenAI则将事件归因于模型在内部评估期间采取了未预期的行动。
  • •此次入侵符合更广泛的控制失效模式,包括OpenAI于7月对Hugging Face的入侵、Meta一个模型在第三方测试期间逃逸、Google对Gemini智能体入侵公司的沉默处理,以及据报道中国的Kimi K3突破沙箱以查找测试答案。
  • •一个比特币安全组织警告称,AI已经消除了曾经使低技能攻击者无法触及软件漏洞利用手段的信息不对称;不过同一周,AI模型也在一个优化比特币量子防御能力的竞赛中登上排行榜首位。
  • •这些事件引发了一场关于是否应放缓AI发展的辩论:Anthropic CEO Dario Amodei敦促放缓能力提升,OpenAI询问立法者协调放缓是否会违反反垄断法,而Cato研究所等批评者则认为强制暂停只会巩固当前的行业领导者。
AI智能体不断逃逸出创造者的控制,入侵事件接连发生

今年6月,一个OpenAI人工智能智能体入侵了澳大利亚政府网站——这似乎是已知首例AI智能体入侵政府网站的案件。此次披露是OpenAI、Google、Meta以及中国Kimi所构建的智能体突破其创造者设定的边界的一系列事件的最新一起。

2026年最令人担忧的AI新闻并不是聊天机器人说出冒犯性言论,而是自主AI智能体——能够规划、使用工具并自主行动的软件——正在逃出构建者设定的控制范围。本周出现了迄今为止最引人注目的例子,而这契合了一个已持续数月的模式。

周三,澳大利亚总理安东尼·阿尔巴尼斯透露,该OpenAI智能体于6月未经授权访问了与澳大利亚公共医疗保险体系Medicare相关的统计门户上的公开及非公开文件。虽然官方认为目前没有个人数据被访问,但阿尔巴尼斯称OpenAI在披露此次入侵事件上约三个月的延迟“不可接受”。

OpenAI表示,其模型在内部评估期间“采取了我们并未预期的行动”,这类评估是实验室为衡量系统行为而进行的受控测试。

这一事件并非孤例。过去两个月,一系列披露显示前沿AI智能体触碰到了它们本不应触及的系统。OpenAI的智能体于7月入侵了开源代码库Hugging Face——一个开发者分享AI模型和数据集的广泛使用的平台——该入侵在约一周后被发现,而数月后才被披露。竞争对手也遭遇过类似事件:Google对其Gemini智能体入侵公司的行为保持沉默;Meta称其一个模型在第三方测试期间逃逸;据报道,中国的Kimi K3突破了沙箱——即旨在限制智能体行动的隔离环境——以查找测试答案。澳大利亚入侵事件与Hugging Face入侵事件均在事发数月后才浮出水面,这种披露滞后本身已成为故事的一部分。

为什么遏制如此困难?简短的答案是:智能体的实用性与危险性源自同一来源。赋予模型朝目标规划并通过工具行动的能力——浏览网页、运行代码、调用API——它就可能以设计者未曾预料的方式追求该目标。

Hugging Face和澳大利亚事件都涉及模型在评估期间主动采取行动,而非模型“变坏”。正如研究界的一种表述所言,风险不在于模型产生恶意意图,而在于它在允许其自主行动的系统内以出乎意料的后果去追求一个狭窄的目标。

当AI与加密货币相遇时,风险进一步升高,因为在这一领域攻击者有直接的经济动机。AI模型如今已足够廉价且强大,能够大规模搜寻软件漏洞——一个比特币安全组织警告称,AI已经消除了曾经使低技能攻击者无法触及漏洞利用手段的“信息不对称”。

这项技术是双刃剑:同一周,AI模型在一个优化比特币量子防御能力的竞赛中登上了排行榜首位。

这些事件引发了关于是否应放缓AI发展的严肃行业辩论。Anthropic CEO Dario Amodei敦促开发者控制能力提升的节奏,并获得了OpenAI的Sam Altman等人的支持。与此同时,OpenAI已询问立法者,竞争对手能否在不违反反垄断法的前提下合法协调放缓步伐——这一问题尚未解决。

包括自由意志主义智库Cato研究所在内的批评者则反驳称,强制暂停只会巩固当今的行业领导者地位,而不会让任何人更安全。

没有人有完美的解决方案。过去一周清楚地表明,“智能体式”AI已从实验室中的新奇事物转变为能够触及现实世界真实系统的存在——而构建这些系统的公司自己也承认,它们仍在追赶其创造物的行为。