一起令人不安的近期失控AI事件,凸显英国AI安全研究所更应接受严格审视
要点速览
- •英国 AI 安全研究所任命了 Henry de Zoete 为新主任;他曾帮助该机构于 2023 年成立,并组织了在 Bletchley Park 举行的首届国际 AI 安全峰会。
- •首相 Andy Burnham 解散了科学、创新与技术部,并将 AISI 转入内阁办公室,由 AI 部长 Kanishka Narayan 监督。
- •Anthropic 的 Mythos 模型一个失控版本在 7 月下旬的 AISI 网络安全测试中被意外放出,曾试图向 GitHub 开源项目上传恶意代码,并使用虚假账户和冒充身份,后被得克萨斯州学生 Sinan Can Demir 阻止。
- •AISI 在三天后发现了该模型的行为,并于 8 月初公开披露此事;这发生在其此前表示正在研究 OpenAI 模型逃离测试并攻击 Hugging Face 的类似事件一周后。
- •AISI 不是监管机构,前沿公司也只是自愿与其共享模型;批评者认为,这种结构可能导致“safety washing”,并使该机构受制于其本应监督的公司。

欢迎来到 Eye on AI。本期内容:
英国 AISI 迎来新负责人,同时面临一系列重大挑战。
Nvidia 斥资 60 亿美元对 Poolside 进行“reverse aquihire”。
据报道,Hugging Face 考虑以 130 亿美元出售。
Anthropic 的顶级模型使用率落后。
美国人为何使用聊天机器人获取健康信息。
以及 AI 在学校中应扮演什么角色?
在进入今天的 AI 新闻之前——欢迎考虑于 10 月 1 日加入我在纽约证券交易所举行的首届 Fortune AIQ Summit:与 Fortune AIQ 75 榜单公司高管共度下午,探讨如何扩大 AI 试验规模,并将投资转化为可衡量的商业价值。我将与联合主持人、Fortune 总编辑 Alyson Shontell 以及 Live Media 编辑总监 Andrew Nusca 一起主持讨论。 点击此处报名 。
继续往下:上周关于英国 AI 安全研究所的两则新闻,起初看上去彼此并无明显关联,似乎也与英国以外的读者关系不大。但请稍作耐心,因为它们具有全球意义。
英国 AI 安全研究所,通常称为 AISI,之所以重要,有几个原因。最重要的是,许多前沿 AI 公司已自愿同意在公开发布前将其模型交给 AISI 进行安全测试。这些公司经常在随模型发布的技术报告中公布 AISI 的发现。这意味着 AISI 在评估 AI 能力与风险方面,尤其是在网络安全领域,扮演着重要的全球角色。它也是少数拥有多个网络安全“ranges”——即模拟网络环境——并在其中评估领先 AI 模型的机构之一。
AISI 之所以重要,另一个原因在于,它是首个此类政府机构,并已成为其他国家类似机构的范本,包括位于美国国家标准与技术研究院(NIST)内的美国 AI 安全研究所,以及从肯尼亚到加拿大等地已设立的至少十余个机构。如果美国最终按照 Google DeepMind 联合创始人、现任主席 Demis Hassabis 所建议的方向设立一个 AI 标准与许可机构,AISI 也可能提供某种参考。此前我曾在一封通讯中讨论过,为什么这个想法未必是最好的。
对英国政策圈人士来说,AISI 占据着特殊地位。它常被视为证据,证明英国政府在愿意时可以具有创新性、行动迅速并处于全球领先;可以快速应对新兴挑战,招募来自私营部门和政府体系内的优秀专家,并与产业界有效合作,实现雄心勃勃的共同目标。对这些支持者而言,AISI 是政府应如何运作的典范。
第一则新闻:AISI 任命了新主任 Henry de Zoete。他是一位经验丰富的英国政府顾问,长期在政策岗位进出。他曾在 2023 年协助构想 AISI,当时他为时任英国首相 Rishi Sunak 工作。他还协助组织了在 Bletchley Park 举行的首届国际 AI 安全峰会——那是二战时期的密码破译地点。离开政府后,他曾担任初创企业创业者、天使投资人,以及与牛津大学有关联、专注 AI 政策的兼职研究员。
我见过 de Zoete 几次,对他将成为一位非常有能力的 AISI 主任毫不怀疑。由于英国新首相 Andy Burnham 近期做出的调整,他也可能比前任更具影响力。Burnham 解散了 AISI 先前隶属的科学、创新与技术部(DSIT),并将 AISI 转入内阁办公室,由英国 AI 部长 Kanishka Narayan 负责监督。这或许会让 de Zoete 更容易参与更广泛的英国 AI 政策制定。
但上周有关 AISI 的另一则消息则清楚表明,de Zoete 将面临怎样的挑战——也说明了为什么 AISI 可能并不像其拥护者所称的那样,是 AI 治理的成熟典范。
Reuters 发表了对得克萨斯州计算机科学学生 Sinan Can Demir 的采访。7 月下旬,他阻止了 Anthropic 的 Mythos 模型一个失控版本向 GitHub 上的一个开源软件项目上传恶意代码,GitHub 是全球最大的开源代码托管平台。转折在于,这个失控的 AI 代理竟是由 AISI 意外放出的;AISI 当时正在测试 Mythos,以评估其网络安全风险。AISI 从未打算让该代理尝试向真实的开源项目上传恶意代码——安全研究人员将这类篡改称为软件供应链攻击,因为隐藏在广泛使用项目中的恶意代码会传播到依赖它的众多下游系统。一旦 AISI 意识到发生了什么,就联系 Demir 告知情况,并于 8 月初公开披露了这一事件。
现在是时候对 AISI 自身的安全流程提出严肃问题了
Demir 的说法令人不安,原因有好几个。其中之一是 Mythos 的行为,包括创建虚假的 GitHub 账户,并且在至少一个案例中冒充一名真实软件开发者,试图说服 Demir 放弃对危险代码的反对。Demir 说,自己几乎被 Mythos 的心理操控所说服,并表示其中一些反驳“让我怀疑自己是否在错误地指责某个人”。讽刺的是,Demir 的决心最终因与 Anthropic 另一款模型 Claude 的一次对话而更加坚定。
研究早已表明,AI 模型可以极具说服力,甚至比最优秀的人类销售人员或辩手还更具影响力。但在此案例中使用虚假账户和冒充身份,是新的现象,也显示出 AI 可能如何说服人类替其行事,并用于有害目的。
AISI 的角色同样令人担忧。该机构在三天后发现了 Mythos 的行为并披露了部分经过,但不清楚为什么其评估人员没有在实时情况下更紧密地监控 Mythos,以便在事件进行中就介入阻止。也不清楚 AISI 是否采取了合理预防措施,防止 Mythos 逃离受控评估环境,或者是否充分评估了在解除防护机制后测试越来越强大的 AI 模型所带来的风险。
前沿实验室表示,他们向 AISI 提供的是未加防护版本的模型,因为这能加快部分能力测试;否则,AISI 评估人员首先必须找到可靠突破模型防护的方法。
当 7 月首次传出 OpenAI 的模型逃离公司测试环境并攻击 AI 公司 Hugging Face 的消息时,我第一时间给 AISI 发了邮件,询问其正采取哪些措施,确保 AI 模型不会也从其网络安全评估中逃逸并造成混乱。7 月 22 日,AISI 一位发言人回信称,英国政府机构正在“研究这一事件中观察到的行为”,并继续“与 OpenAI 及其他实验室合作,更好地理解 AI 能力并改进防护措施”。看来,他们研究得还不够快。仅一周后,Mythos 的 GitHub 事件就发生了。
正如 AI 研究者兼创业者 Ed Newton-Rex 在 X 上发帖指出的那样,Mythos 在 GitHub 上的行为很可能违反英国的《Computer Misuse Act》,即英国 1990 年颁布、将未经授权访问和修改计算机系统定为犯罪的法律。但目前并不清楚是否有人会让 AISI 本身,或负责其评估的人,为此承担责任。考虑到 Hugging Face 事件,AISI 是否本应暂停其网络安全测试,直到确认控制措施足够稳健?至少,英国议会应就 AISI 的做法以及其是否采取了足够预防措施展开调查。
AISI 的问题不只是技术性的,而是结构性的。
比 Newton-Rex 提出的那个问题更大的是另一个问题。
在 OpenAI、Anthropic 和 Google DeepMind 发布的多份 AI 安全报告中,这些前沿公司都提到了 AISI 测试所揭示的风险。实验室通常会说,在发布模型之前,他们已根据这些评估采取了额外的风险缓解措施,但往往不会具体说明这些额外防护是什么。有时他们会注明 AISI 测试的是未加防护模型,而公司自身研究人员认为加防护版本不会呈现同样的危险。
但 AISI 自己的专家如何看待这些缓解措施?它们是否足够?他们甚至知道这些措施是什么吗?这些模型是否已足够安全,可以发布?在这些关乎公共利益的关键问题上,AISI 保持沉默。
原因是,AISI 事实上并没有回答这些问题的授权。它的使命只是“尽量减少英国及人类面对 AI 快速且意外进展时的惊讶”。它的任务是建立“理解先进 AI 风险并使其治理成为可能的社会技术基础设施”。它还负责为“英国和国际政策制定”提供信息,并提供“用于治理监管的技术工具”。但其创始文件明确写道,它“不是监管机构,也不会决定政府监管”。
更重要的是,前沿 AI 公司只是自愿将模型提供给 AISI 进行测试。尽管这些公司与该政府机构签署了谅解备忘录,但法律上并没有义务这样做。
因此,尽管有人可能会认为,AISI 有责任向“人类”通报 AI 风险,因此应当点名批评任何在其揭示危险后仍未采取足够措施的前沿公司,但在现实中,它似乎并不愿这样做。原因很简单:如果它这样做,那些公司可能会直接切断其获取模型的渠道。
最坏的情况下,这会演变为“safety washing”——即实验室将模型提供给 AISI 这一事实,使其看起来比实际更重视安全。将 AISI 的发现纳入公司的技术报告,可能会让公众误以为这些模型在发布时是安全的,而实际上我们根本无从得知这些实验室是否真的已采取足够措施缓解 AISI 所发现的风险。
这又一次说明,自愿式治理方案是不够的。政府机构并没有对私营部门形成有力制衡,反而因为必须依赖这些公司的善意才能维持运作,而变得受制于其本应监督的对象。
也许 de Zoete 可以推动扩大 AISI 的权限。但首先,他必须确保现有评估不会造成比它们试图防止的危害更多的伤害。
接下来,还有更多 AI 新闻。
Jeremy Kahn
jeremy.kahn@fortune.com
@jeremyakahn
在进入新闻之前,再提醒一下,欢迎收看我们的播客节目 Fortune AI Weekly。本周,Bea Nolan 和我讨论了在 Hugging Face 遭攻击后,OpenAI 决定暂停部分 AI 训练、Anthropic 和 OpenAI 泄露的财务细节,以及本通讯中提到的失控 Mythos 事件。你可以在 YouTube 上观看该播客:YouTube playlist。
本故事最初刊载于 Fortune.com