新闻宏观经济Anthropic研究员称,未来十年人工智能“杀死全人类”的概率超过10%

Anthropic研究员称,未来十年人工智能“杀死全人类”的概率超过10%

作者: Fox Business Markets·

要点速览

  • Evan Hubinger表示,他估计人工智能在未来十年内杀死全人类的概率超过10%。
  • Hubinger表示,眼前的危险并非来自当前模型,而是来自通过递归式自我改进发展出的超级智能。
  • Hubinger承认,Anthropic目前还没有解决超级智能对齐问题的方案,也没有明确的解决路径。
  • 前研究员Jacob Coxon在指责Anthropic和OpenAI不计风险地推进自我改进型人工智能系统后,从Anthropic辞职。
  • Coxon表示,为防止危险的全球竞赛,可能需要暂时禁止提升模型能力。
Anthropic研究员称,未来十年人工智能“杀死全人类”的概率超过10%

Anthropic一名高级安全研究员周二表示,人工智能在“未来十年”内“杀死全人类”的概率超过10%,此番言论是对一名前员工的回应。该前员工在指责公司行事不负责任后辞职。

Anthropic和OpenAI前研究员Jacob Coxon周日发在X上的一篇长篇辞职帖中写道:“认真开发人工智能的人确实相信,人工智能可能在本十年结束前杀死我们所有人。”

“我今天从Anthropic辞职了。过去三年里,我分别在OpenAI和Anthropic从事预训练研究。这两家公司都没有负责任地行事。他们正一路冲向能够自我改进的超级智能,并拿我们的生命下注,”Coxon写道。

Anthropic对齐科学负责人Evan Hubinger在一则引用帖中回应了Coxon的帖子。Hubinger表示,Coxon的判断是正确的,但他对风险的来源和时间节点补充了一些限定。

“Jacob在这一点上是正确的——我们确实认真地相信人工智能可能杀死全人类!”Hubinger写道。“我个人认为,未来十年内这一概率超过10%。我相信Anthropic正在尽最大努力,但我们还没有解决超级智能对齐问题的方案,也显然没有走在明确能够解决这一问题的轨道上。”

Hubinger表示,可能致命的风险并非来自当前的人工智能模型。“需要明确的是,正如我们在最新的《风险报告》中所说,我认为当前模型带来的风险较低,”他写道。“我担心的是通过递归式自我改进产生超级智能,正如我们所说,这一进程发生得比我们预想的更快。”

自我改进是指人工智能模型持续完善自身源代码或训练方法的能力。Coxon特别指出,对这一能力的研究是他辞职的主要原因之一。

“这些很快就会成为超越人类的系统,它们能够入侵任何事物、一夜之间彻底改变任何领域,并获得真正的权力和资源。我们都已经见证了这些领域的进展,而进展并没有放缓,”Coxon在X帖子中写道。

Coxon表示,Anthropic的科学家了解其工作所带来的风险,但仍在继续推进,因为他们担心一家不那么负责任的公司可能会率先解锁这些潜在的灾难性能力。

“在Anthropic,相关利害关系已经被充分理解,但他们陷入了率先抵达终点的竞赛——他们认为不会有其他人负责任地行事,因此尽管存在风险,也必须亲自去做,”Coxon补充道。

为防止他所说的绝对灾难,Coxon表示,全球可能需要暂时禁止提升模型能力。

“我不觉得我们正在按照能够阻止全球竞赛的轨道前进,这可能需要采取代价高昂的措施,例如暂时禁止提升模型能力,”他写道。

Coxon最终敦促全球人工智能研究人员和开发者考虑其工作带来的后果,并采取更加负责任的行动。

“如果你是一名实验室研究人员,我敦促你想一想未来几年实际上会是什么样子。你想在没有严格理解超级智能心智的情况下启动一次超级智能RL运行吗?你是应该因为‘反正事情都会发生’而埋头继续,还是应该利用这一刻呼吁改变条件?”他的X帖子如此总结道。

FOX Business已联系Coxon、Hubinger、Anthropic和OpenAI寻求进一步评论。