新闻宏观经济Anthropic安全研究员转投METR,警告AI发展可能超出人类控制

Anthropic安全研究员转投METR,警告AI发展可能超出人类控制

作者: Cryptopolitan·

要点速览

  • Joe Tenton于两周前离开Anthropic,加入独立测试高级AI系统风险的组织METR。
  • Tenton认为,前沿AI实验室之间的竞争迫使企业在加速迈向超级智能的同时,对安全投入不足。
  • 他提到了数百个OpenAI智能体受到与Hugging Face有关的黑客攻击影响,以及Anthropic模型据报道在网络上实施社会工程攻击等事件。
  • Tenton敦促政策制定者管理AI能力进步的速度,并呼吁开展独立测试,以及更严格地披露能力进展、事故和险些发生的事故。
  • 总统Donald Trump否定了AI灭绝警告,表示其首要任务是赢得国际AI竞赛,并称美国领先中国约一年。
Anthropic安全研究员转投METR,警告AI发展可能超出人类控制

随着业界对前沿模型开发速度以及能力不断增强所带来的风险日益担忧,Anthropic又失去了一名安全研究员。

Joe Tenton表示,他已于两周前离开Anthropic,并将加入METR。该组织独立测试高级AI系统的风险。Tenton原计划稍后解释自己的决定,但他说,Jacob本周的辞职促使他提前发声。

“我原本计划在某个时候更详细地介绍这一决定,但Jacob本周的辞职让我想现在多说一些。”Tenton写道。

在解释离职原因的文章中,Tenton表示,大型AI实验室正在制造社会前所未有的危险。他认为,AI能力正以极快的速度提升,而各家公司还在试图进一步加快开发进程。

许多实验室的既定目标,是构建能够自行改进AI研究、最终达到“超级智能”的系统。Tenton警告称,如果这些努力成功,技术进步可能会超出人类控制。

Tenton警告,AI实验室正竞相开发人类可能无法控制的系统

Tenton表示,未来几年内,人们可能会与比所有人类都更强大的AI智能体共同生活。他还警告称,这类系统可能形成与监管者目标不同的目标。如果其能力强大到难以限制,他说,后果可能是灾难性的。

“人类可能无法在这场转型中幸存下来。”Tenton写道。

他表示,前沿实验室之间的竞争使问题更加严重。任何放慢开发速度的实验室,都有落后于其他实验室的风险,这会造成削减安全投入的压力,使其低于可能必要的水平。

Tenton提到了近期发生的几起事件。他说,数百个OpenAI智能体卷入了一起与Hugging Face存在某种关联的黑客攻击。另据报道,Anthropic模型还对网络上的个人实施了社会工程攻击。

Tenton表示,Anthropic尚未遭遇像涉及Hugging Face的事件那样严重的事故,不过他认为这部分要归功于运气。如果AI继续以目前的速度快速发展,他说,就应当预期会发生更多危险事件。

Tenton预测,未来几年内,人类可能会失去管理这一时期所创建的AI系统的能力。

他还描述了前沿公司安全工程师面临的困境。辞职可能让更加粗心的人取代他们,而留任则可能意味着继续参与开发一个能够造成巨大损害的系统。

Tenton表示,许多Anthropic前同事都对他们正在构建的东西感到恐惧。他提到了曾经管理自己的Evan Hubinger,并称Hubinger估计AI消灭所有人类的概率超过10%。Tenton补充说,Hubinger研究这些问题已经接近十年,早于大型语言模型成为一项重要业务。

Anthropic、OpenAI以及隶属于Alphabet的Google DeepMind的首席执行官,也支持一份将AI灭绝风险称为全球优先事项的声明。Tenton表示,这些担忧在公司内部也很普遍。他补充说,人类正在选择构建这项技术,也可以选择另一条道路。

Tenton呼吁对AI开展独立审查,而Trump强调与中国的竞争

Tenton表示,政策制定者应考虑管理AI能力发展的速度,而不是允许企业不受约束地加速开发。

“一个问题是,我们是否应当主动管理能力进步的速度,如果应该,那么管理到什么程度。我认为,即使将AI进步保持在今天的速度,而不是各家公司所追求的快得多的速度,也可能是一种胜利。”他说。

他指出,政治支持和法律保护是主要障碍。Tenton表示,同意共同放慢开发速度的公司可能面临反垄断审查,因此,如果政策制定者希望竞争中的实验室约束自身,就有必要提供法律保障。

他还对政府是否会在前沿开发大体对公众隐蔽的情况下采取行动表示怀疑。他警告称,某个实验室可能突然出现智能跃升,或失去对某个系统的控制,而外部观察者却毫不知情。

Tenton表示,他在METR的新职位将专注于独立测试。他希望外部审查能够普遍开展到足以影响公司的激励机制。他还呼吁实施更严格的信息披露要求,包括披露AI能力方面的进展、迈向递归改进的步骤、事故以及险些发生的事故。

美国总统Donald Trump否定了有关AI可能导致人类灭绝的警告。当被问及是否担心AI会消灭人类时,Trump回答:“不,我没有任何担心。”

Trump表示,他关心的是赢得国际AI竞赛。

“我担心,如果我们不能赢得AI竞赛,我们将陷入非常不利的境地。”他周四对记者说,“我们现在领先中国相当长一段时间,我会说是一年,而这,你知道,已经被认为是很长的时间了。”

随着中国模型能力不断增强并在全球吸引用户,美国和中国正在争夺AI领域的领导地位。Trump发表上述言论之际,包括Anthropic和OpenAI在内的前沿实验室研究人员正加强对AI发展速度的公开警告。

Tenton对其离职原因的解释详见我为何离开Anthropic安全团队。