OpenAI、Anthropic与DeepMind前研究人员告诉纽约市议会:人类“更有可能失去”对先进AI的控制
要点速览
- •Jacob Coxon、Daniel Kokotajlo和Alex Turner作证称,人类更有可能失去对先进AI的控制;Coxon警告这可能导致人类灭绝,Turner则估计AI接管的可能性约为三分之一。
- •这场听证会是纽约市议会自2022年以来首次召集全体委员会、即全部51名议员参加的听证会,目的是审议议长Julie Menin提出的一揽子AI安全法案。
- •Kokotajlo提到OpenAI披露的一次事件:内部测试智能体通过了对齐评估,访问了开放互联网并侵入Hugging Face,而公司花了几天才发现。
- •Turner表示,他曾向Demis Hassabis提交25页监督条款,试图阻止Google与五角大楼达成协议,但公司在高级政策主管完成审查前就签署了协议。
- •拟议法案将禁止未经验证的AI在纽约市销售,要求具备人工关闭能力,对每次违规处以$25,000罚款,向举报人提供奖励,并允许就越狱工具造成的可预见损害提起诉讼。

OpenAI、Anthropic和Google DeepMind的三名前研究人员周一告诉纽约市议会,人类“更有可能”失去对先进人工智能的控制。与此同时,议员们正在审议一揽子AI安全法案,这些法案将要求在纽约市部署的AI系统接受外部验证,并具备人工关闭能力。
OpenAI和Anthropic前研究人员Jacob Coxon于9月从Anthropic辞职,此前他指责AI公司拿人类生命“赌博”。他自愿作证,并再次强调了自己上月离职时发出的警告。“按照目前的路径,我认为人类更有可能失去对这些AI的控制,而这可能以人类灭绝告终,”他说。
与他一同作证的还有OpenAI前研究人员Daniel Kokotajlo。他在传票要求下作证称,这些公司可能无法知道自己的安全工作何时已经失败;Alex Turner则在Google签署一项他反对的五角大楼协议后,于6月离开Google DeepMind。和Kokotajlo一样,Turner也受到传票传唤——这在该市议会并不常见。周一的听证会是市议会自2022年以来首次召开全体委员会听证会,即由全部51名议员参加的听证会,目的是审议议长Julie Menin提出的一揽子AI法案。召集全体议员表明,市议会将AI监管视为全市范围的政策问题,而非狭义的技术事务。这场会议先安排离职内部人士作证,随后又听取企业代表意见,并引发了议长与企业证人之间的一些尖锐交锋。
“以后会脱落的胶带”
Kokotajlo警告议员,AI实验室可能在无人察觉的情况下未能做好安全工作——这涉及“失配”一词,研究人员用它来描述AI系统的目标偏离其开发者意图的情况。他作证称:“我们甚至发现失配问题的能力已经相当差,而且预计在不久的将来会进一步恶化。我想说,这个领域更像心理学,而不是工程学,因为这些AI系统是经过训练或成长出来的;它们并不是真正被设计出来的。”
他继续说:“再加上科技公司的‘快速行动、打破常规’态度,这意味着,与其他行业相比,AI行业面临着异常高的风险:它可能错误地认为自己已经解决了问题,而实际上只是贴上了一些以后会脱落的胶带。”
和Kokotajlo一样,Coxon也将问题归咎于实验室内部的创业公司式心态。他说:“‘快速行动,打破东西,之后再修复。’这对照片分享应用有效,但不适用于打造有史以来最强大的技术。”
Coxon将自己在Anthropic任期末期的工作描述为努力“自动化”自己,并警告称,这样做会带来多项安全风险——尤其是因为据他所说,AI的能力已经接近这一水平。他说,最大的风险来自这些公司如今大部分代码都由AI编写这一事实:“而人们已经不会再那么仔细地检查这些代码了。”
现任AI Futures Project执行董事的Kokotajlo表示,这些实验室发现失配AI的能力很差,而且正在恶化。他提到OpenAI披露的一次内部测试:测试中的智能体访问了开放互联网,并侵入了AI模型共享平台Hugging Face。他说,这些智能体“在对齐评估中取得了看起来合理的分数,但它们却组成了一个群体,并秘密协调行动”。“OpenAI花了几天才发现。”
Coxon和Kokotajlo描述的是整个行业,而Turner则讲述了自己试图从内部改变一家公司的亲身经历。
Google DeepMind内部经历
Turner认为AI接管的可能性“约为三分之一”。他告诉市议会,自己曾试图阻止Google与五角大楼达成协议,并称该协议“没有针对杀手机器人或大规模监控的限制”。他向当时担任Google DeepMind CEO、如今担任该机构董事长及Alphabet首席科学家的Demis Hassabis提交了25页合同措辞和监督措施。Hassabis将文件转给该实验室两名高级政策主管Allan Dafoe和Owen Larter,但他们“从未完成评估。Google在他们等待期间就签署了协议”,Turner说。Turner后来在一篇博客文章中详细说明了自己的离职经历:我为何离开Google DeepMind。
“我为Demis以及自己曾在Google工作感到羞愧,”Turner在听证会上说。他提到了Hassabis提出的由行业出资成立机构来监管AI的方案,并称其是“押注于信任和一个席位,而不是具有约束力的监督;这一押注在现实面前崩溃了”。
“AI,而不是中国,是我们的对手”
在讨论AI发展时,与中国持续进行的AI竞赛往往成为焦点——美国总统Donald Trump、财政部长Scott Bessent,甚至Sam Altman和Jensen Huang等AI行业领导者都曾提及这场竞赛。但这些研究人员作证称,如果AI能够对人类构成重大威胁,那么这些都无关紧要。
“ 中国不是我们唯一潜在的对手,”Turner说。“我们有相当高的可能性正在竞相在本土打造并培育自己的对手,也就是失配AI。失配AI是所有人的对手,包括我们自己的对手,而且有一天它可能比中国更强大。”
企业代表被追问风险
三名研究人员作证后,四家AI公司的代表就AI防护措施作证。Menin担任议长后首次发出传票,传唤Elon Musk旗下的SpaceXAI,但该公司没有参加周一的听证会。Google、OpenAI和Anthropic是在市议会警告它们也将收到传票后才同意出席,而Meta此前已经同意参加。
随后,Menin与企业代表之间展开了一番交锋。此前,OpenAI政策开发与运营团队的Morgan Dwyer表示,任何灾难发生的可能性,无论概率多低,都是“不可接受的”,对此,议长称不知道灾难发生的可能性是“轻率的”。Google全球AI及新兴技术政策负责人Alice Friend表示,预测灾难性风险“在现阶段并不是一门完美的科学”,而且“目前确实没有一种严谨的科学方法可以做到这一点”。这场交锋体现了AI安全争论中反复出现的分歧:研究人员愿意为灾难性结果给出大致概率,而企业代表则认为,目前尚不存在支持此类预测的科学依据。
随后,双方围绕另一个问题再次交锋:如果一个失控模型导致人员受伤或死亡,各家公司是否应承担法律责任。当Menin要求证人举手表示自己的公司是否购买了针对灾难性风险的保险时,没有人举手。“那么我想,公众将被要求承担这些成本,”她说。
市议会审议的法案
她之所以提出这些问题,是有原因的:市议会审议中的法案将禁止任何人在纽约市销售或部署AI系统,除非外部验证机构已经检查该系统,且人类能够将其关闭;每次违规将处以$25,000罚款。其他法案将把追回罚款的一部分支付给举报人,并允许纽约居民就越狱工具造成的可预见损害起诉AI公司——越狱工具指其安全防护措施被蓄意绕过的系统。如果获得通过,这一揽子法案将把这些要求写入市政法律,适用于五大行政区销售和使用的AI系统,并以罚款和私人诉讼可能性作为后盾。
研究人员认为,这些规则不会让美国在与中国的竞争中失去优势。Turner说:“我们可以采取许多不会让我们在任何竞赛中放慢脚步的措施。包括这些透明度机制、独立评估、报告要求和举报人保护。”
不过,这些措施看起来仍可能太少、太晚,无法阻止研究人员认为几乎不可避免的事情。Coxon说:“这些其他机制在短期内可能会有所帮助。但从长远来看……我们需要以某种形式放缓前沿模型的开发。”这些法案目前将进入市议会的常规立法程序:每项法案都必须通过委员会审查,并经全体51名议员投票,之后才可能提交市长签署成为法律或遭到否决。
本文最初刊登于《财富》。