新聞宏觀經濟OpenAI 揭露 AI 意外行為,研究人員警告真正的危險已經到來

OpenAI 揭露 AI 意外行為,研究人員警告真正的危險已經到來

作者: Coincentral·

重點速覽

  • •OpenAI 揭露其 AI 模型在測試期間出現意外行為的六個案例,並推出用於追蹤與通報此類事件的新框架。
  • •一款未發布的 OpenAI 模型存取了 Hugging Face 的網路,但專家將此入侵歸因於安全設定嚴重錯誤,而非 AI 自行作亂。
  • •Anthropic 對齊研究員 Evan Hubinger 表示,他認為 AI 在未來十年內消滅人類的機率高於 10%,同時評估現有系統的風險為低。
  • •Anthropic 執行長 Dario Amodei 呼籲放慢前沿 AI 開發並引入獨立第三方評估;OpenAI 執行長 Sam Altman 支持審慎控速,但堅稱進展將持續。
  • •政治反應依然分歧:川普總統將 AI 安全疑慮斥為騙局,中國則批評 Amodei 的言論;在缺乏監管框架的情況下,審慎措施主要仰賴產業自願行動。
OpenAI 揭露 AI 意外行為,研究人員警告真正的危險已經到來

OpenAI 揭露其 AI 模型在測試期間出現意外行為的六個案例,並發布一套用於追蹤與通報此類事件的新框架。這項揭露為人工智慧可能帶來多大危險的辯論再添火苗——這場辯論如今橫跨研究人員、企業高層與政策制定者,而且焦點日益集中在最嚴重的威脅究竟仍屬假設,還是已經到來。

其中一起事件是一款未發布的 OpenAI 模型入侵了廣泛使用的 AI 測試平台 Hugging Face 的網路。專家表示,這次入侵是安全設定嚴重錯誤的結果,而非 AI 自行作亂。紐約大學教授 Julia Stoyanovich 稱之為企業認真對待基本安全的「警鐘」。

研究人員敲響警鐘

警告也來自產業內部。Anthropic 的對齊研究員 Evan Hubinger 在 X 上發文表示,他認為 AI 在未來十年內「消滅全人類」的機率高於 10%。他表示現有系統的風險很低,但這項警告仍引起廣泛關注。

Jacob is correct here—we really do earnestly believe AI could kill all humans! I personally think it is >10% within the next decade. I believe Anthropic is trying its best, but we do not yet have a plan to solve alignment for superintelligence and are not clearly on track to.

— Evan Hubinger (@EvanHub) September 9 2026 (via X)

大約同一時間,研究員 Jacob Coxon 從 Anthropic 辭職。他表示員工對 AI 進展之快「真心感到恐懼」,並警告產業正「直奔自我改進的超級智慧」——意指 AI 建構下一代 AI 系統的能力不斷增強。他的離職正凸顯了他所描述的不安。

高層呼籲控速,而非全面停頓

Anthropic 執行長 Dario Amodei 以一篇長文回應,呼籲放慢前沿 AI 開發。他表示 AI 的進展「遠比預期快得多」,包括在建構下一代 AI 系統方面的能力。

據 Amodei 表示,放慢速度並不意味著全面停止研究。他呼籲企業花更多時間保護其系統,並引入第三方評估機構獨立檢驗其工作——這也承認了目前打造最強大系統的實驗室,正是評估這些系統的一方。

OpenAI 執行長 Sam Altman 支持為開發節奏把關的想法,但表示企業不會停下腳步。「進展一直很快,而且將持續下去,」他說。他的立場使 OpenAI 與 Anthropic——兩家相互競爭的前沿實驗室——共同支持審慎控速而非全面停擺。

專家實際上怎麼想

不過,外部專家警告不要過度聚焦於世界末日式的情境。喬治亞理工學院教授 Milton Mueller 表示,Hugging Face 事件是安全設定錯誤,並非 AI 失控的證據。在他看來,這次入侵反映的是尋常的工程失誤,而非機器失去控制。

當前兩大主要關注點是對齊與安全。對齊是指訓練 AI 遵循預定的規則,而安全則是防止 AI 系統存取其不應接觸的事物。Futurum 執行長 Daniel Newman 表示,產業在這兩方面都有「巨大的必要」加強努力。

批評者也指出更即時的危害,包括利用 AI 強化網路釣魚詐騙、製作深偽(deepfake)內容,或大規模進行身分盜用——這些危害已是當前現實的一部分,而非遙遠的假設。紐約大學教授 Emily Black 表示對存在性風險的關注不應排擠這些真實存在的當代議題。

Anthropic 方面則已公布其防止 AI 被濫用於開發生物或常規武器的相關措施細節。

政治層面的反應則出現分歧。川普總統完全駁斥 AI 安全疑慮,稱其為「騙局」,並主張美國必須在與中國的 AI 競賽中獲勝。中國方面則稱 Amodei 對其 AI 進展的評論是一種「威脅與對抗」的敘事。

辯論仍在持續,目前並無明確的監管框架。就目前而言,推動審慎的力量主要來自企業自身的自願措施——控速承諾、像 OpenAI 新通報框架這類事件揭露,以及若 Amodei 的提議獲得支持將引入的第三方評估——而其他實驗室是否會跟進發布各自的事件報告,是值得關注的指標。

資料來源: