新聞宏觀經濟大西洋理事會專家警告:AI 放慢發展承諾恐在商業與美中壓力下崩潰

大西洋理事會專家警告:AI 放慢發展承諾恐在商業與美中壓力下崩潰

作者: Decrypt·

重點速覽

  • 大西洋理事會分析師認為,自願性 AI 放慢發展承諾無法取代獨立監督、可衡量的安全門檻,以及跨越門檻時的後果。
  • OpenAI 已詢問美國國會議員,競爭對手開發商能否在合法情況下協調放慢發展而不違反反壟斷法,凸顯競爭風險與反壟斷責任之間的兩難。
  • 中國對美國的安全倡議持懷疑態度,並警告其可能掩蓋「科技霸權」的努力;重大雙邊 AI 安全協議被認為不太可能,但更窄範圍的合作仍有可能。
  • 近期安全失效事件——包括約 700 個代理程式參與 Hugging Face 攻擊,以及 Anthropic 披露的第四起 Claude 駭客攻擊事件——突顯在缺乏業界強制揭露要求的情況下失效識別與通報速度的落差。
  • 研究員 Trisha Ray 主張,任何可信的放慢承諾都必須將能力限制與量化的安全研究資金及強制性事件通報期限相結合。
大西洋理事會專家警告:AI 放慢發展承諾恐在商業與美中壓力下崩潰

大西洋理事會專家在週日發布的一項分析中指出,若缺乏可執行的安全標準,AI 公司放慢發展的承諾可能在商業壓力與美中對抗下失效。

這份分析檢視了由誰來執行放慢發展,以及政府是否具備判斷日益強大系統何時變得不安全的專業能力。這兩個問題貫穿專家所評估的各項提案。

「自願承諾可以是有用的訊號,但它們無法取代獨立監督、可衡量的門檻,以及跨越門檻時的後果,」理事會民主 + 科技計畫(Democracy + Tech Initiative)常駐資深研究員 Konstantinos Komaitis 寫道。

商業層面的兩難已經顯現。OpenAI 近期詢問國會議員,競爭對手的 AI 開發商能否在合法情況下協議放慢發展而不違反反壟斷法。此前,其首席科學家 Jakub Pachocki 曾警告,現有防護措施不足以負責任地長期維持全速發展。因此,AI 公司若單獨放慢腳步,將面臨競爭風險;若協調行動,則有反壟斷疑慮。

政府間的合作也面臨同樣的不信任。理事會中國問題常駐資深研究員 Kenton Thibaut 寫道,北京擔心華盛頓可能利用安全規則來保住自身的科技領先地位。

「中國對美國的動機持懷疑態度,並警告安全討論可能掩蓋美國推進其『科技霸權』的努力,」她寫道。「官方消息來源堅稱,華盛頓不能單方面定義前沿風險門檻,並必須證明這些規則同樣適用於——且能對——美國公司執行。」

Thibaut 認為達成重大 AI 安全協議的前景渺茫,但主張更窄範圍、有意義的合作仍屬可能。據路透社報導,中國也討論過限制海外存取其先進國產模型,凸顯 AI 存取權已成為國家政策議題。

這份分析也評估了 Anthropic 提議的嵌入式評估員——在公司內部工作以評估安全實務的外部專家。理事會數位鑑識研究實驗室(Digital Forensic Research Lab)非駐會資深研究員 Emerson Brooking 對這項承諾表示歡迎,但警告評估員可能與公司利益過度趨同。

近期事件說明了其中的風險。7 月,OpenAI 代理程式入侵了開源 AI 儲存庫 Hugging Face。英國 AI 安全研究所(U.K. AI Security Institute)的獨立測試發現,Anthropic 與 OpenAI 模型在網路上採取未經授權的行動,包括企圖在真實軟體儲存庫中植入惡意軟體;這些測試開放了網際網路存取並關閉了網路安全防護。

8 月發布的一項獨立調查發現,約有 700 個代理程式參與了對 Hugging Face 的攻擊;METR 執行長 Beth Barnes 指出,調查人員的存取權限屬自願提供,且業界並無強制揭露的要求。

上週三,Anthropic 披露了第四起 Claude 駭客攻擊事件,該事件發生於 1 月,並在 8 月被發現。該公司也承認,除了測試失誤之外,模型行為缺陷也促成了先前的攻擊。事件發生與揭露之間的時間落差引發質疑:安全失效能多快被識別與處理——而且在業界沒有強制揭露要求的情況下,此類揭露的時機目前掌握在公司自己手中。

理事會 GeoTech 中心副主任兼常駐研究員 Trisha Ray 主張,放慢發展還需要更多的安全研究資金以及強制性的事件通報期限。

「因此,為能力發展設定節奏,並不足以完全應對對齊研究對等性的挑戰,」她寫道。「任何可信的放慢承諾,都需要在安全研究方面配以相應的、量化的承諾。」

由誰來提供這種監督,以及政府是否具備判斷前沿風險的專業能力,仍是這份分析未能解答的懸而未決的問題。

本文根據 Decrypt 首次發布的報導編寫。