新聞宏觀經濟Anthropic 研究員稱,未來十年內 AI 將「殺死人類」的機率超過 10%

Anthropic 研究員稱,未來十年內 AI 將「殺死人類」的機率超過 10%

作者: Fox Business Markets·

重點速覽

  • Evan Hubinger 表示,他估計 AI 在未來十年內殺死全人類的機率超過 10%。
  • Hubinger 表示,迫在眉睫的危險並非來自目前的模型,而是來自透過遞迴式自我改進發展出的超級智慧。
  • Hubinger 承認 Anthropic 尚未找到解決超級智慧對齊問題的方案,也沒有明確的實現路徑。
  • 前研究員 Jacob Coxon 辭去 Anthropic 職務,並指控 Anthropic 與 OpenAI 魯莽地追求能自我改進的 AI 系統。
  • Coxon 表示,為防止危險的全球競賽,可能需要暫時禁止提升模型能力。
Anthropic 研究員稱,未來十年內 AI 將「殺死人類」的機率超過 10%

Anthropic 一名資深安全研究員週二表示,人工智慧在「未來十年內」有超過 10% 的機率「殺死人類」,他是在回應一名前員工的言論;該員工因指控公司行事不負責任而辭職。

前 Anthropic 與 OpenAI 研究員 Jacob Coxon 週日在 X 發布一篇篇幅很長的辭職串文,寫道:「認真打造 AI 的人確實相信,到了這十年結束時,AI 可能會殺死我們所有人。」

Coxon 寫道:「我今天從 Anthropic 辭職了。過去三年,我分別在 OpenAI 和 Anthropic 從事預訓練研究。這兩家公司都沒有負責任地行事。他們正直奔能夠自我改進的超級智慧,拿我們的生命下注。」

Anthropic 對齊科學主管 Evan Hubinger 在一則引用貼文中回應 Coxon 的串文。Hubinger 表示,Coxon 的評估是正確的,但也對風險的來源與時間點補充了說明。

Hubinger 寫道:「Jacob 在這點上是對的——我們確實真心相信 AI 可能殺死所有人!」他接著表示:「我個人認為,未來十年內的機率超過 10%。我相信 Anthropic 正在盡最大努力,但我們目前還沒有解決超級智慧對齊問題的方案,也沒有明確朝著這個目標前進。」

Hubinger 表示,可能致命的風險並非來自目前的 AI 模型。他寫道:「需要明確的是,正如我們在最新的《風險報告》中所說,我認為目前模型帶來的風險很低。我所擔心的是,透過遞迴式自我改進產生超級智慧;正如我們所說,這種情況發生的速度比我們原先以為的更快。」

自我改進是指 AI 模型持續強化自身原始碼或訓練方法的能力。Coxon 特別指出,對這項能力的研究是他辭職的主要原因之一。

Coxon 在 X 串文中寫道:「這些很快就會成為超越人類的系統,能夠入侵任何事物、在一夜之間徹底改變任何領域,並取得真正的權力與資源。我們都已見證這些領域的進展,而進展並未放緩。」

Coxon 表示,Anthropic 的科學家了解自身工作的風險,但仍持續推進,因為他們擔心一家較不負責任的公司可能會率先解鎖那些潛在的災難性能力。

Coxon 補充道:「在 Anthropic,相關利害關係已被充分理解,但他們陷入了搶先抵達終點的競賽——他們相信其他人不會負責任地行事,因此即使存在風險,也必須由他們自己完成。」

為防止他所描述的絕對災難,Coxon 建議全球可能需要暫時禁止提升模型能力。

他寫道:「我不覺得我們正朝著防止全球競賽的方向前進,這可能需要付出高昂代價的措施,例如暫時禁止提升模型能力。」

Coxon 最終呼籲全球 AI 研究人員與開發者思考自身工作的後果,並以更負責任的方式行事。

他的 X 串文最後寫道:「如果你是實驗室研究人員,我敦促你思考未來幾年實際會是什麼感受。你想在沒有嚴謹理解超級智慧心智的情況下,啟動一次超級智慧 RL 執行嗎?你應該因為『反正事情就是會發生』而埋頭苦幹,還是把握這個時刻,呼籲改變條件?」

FOX Business 已聯絡 Coxon、Hubinger、Anthropic 和 OpenAI,尋求進一步評論。