新聞宏觀經濟OpenAI 將在開發期間讓第三方團隊審查 AI 模型安全性

OpenAI 將在開發期間讓第三方團隊審查 AI 模型安全性

作者: CryptoBriefing·

重點速覽

  • •OpenAI 於 9 月 22 日宣布,獨立評估者將在 AI 模型開發的較早階段進行審查,將安全檢視從發布前階段提前至開發流程前段。
  • •擴大後的計畫聚焦四個領域:安全論證、防護措施抵禦對抗性威脅的韌性、透過 Preparedness Framework 進行的災難性風險評估,以及未對齊事件。
  • •由於安全論證與 Preparedness Framework 都由內部產出,開放外部評估者檢視可為 OpenAI 自身在發布前的風險判斷增加外部制衡。
  • •OpenAI 公布了七項指導原則,涵蓋科學嚴謹性、評估者獨立性、安全協議,以及負責任的研究結果發布方式。
  • •正式合作夥伴尚未公布;在 Sam Altman 於 9 月 12 日作出承諾後,公司仍與 METR 和 Redwood Research 進行討論,存取條件也尚在協商。
OpenAI 將在開發期間讓第三方團隊審查 AI 模型安全性

OpenAI 將允許獨立團隊在其 AI 模型開發的較早階段進行檢視,公司於 9 月 22 日宣布了這項計畫。此項轉變旨在模型部署前,而不是模型大致完成後,及早發現安全問題。

在擴大後的評估計畫下,獨立審查者將聚焦於四個優先領域。首先,他們將評估 OpenAI 的「安全論證」——也就是公司為特定模型適合安全部署所提出的自身論據。其次,評估者將檢驗關鍵防護措施抵禦對抗性威脅的韌性。第三,評估將直接與 OpenAI 的 Preparedness Framework 掛鉤;這是公司用來在模型發布前衡量災難性風險的內部系統。第四,評估者將調查未對齊事件;在涉及 Hugging Face 的一次安全漏洞凸顯此類失敗可能迅速升級後,這一類事件受到的關注有所提升。

由於安全論證與 Preparedness Framework 都是內部產出,將其交由外部審查者檢視,便能對 OpenAI 自身在發布前如何判斷風險增添外部制衡。

OpenAI 也公布了七項指導原則,規範這些評估應如何進行。這些原則強調科學嚴謹性、評估者獨立性、安全協議,以及以負責任的方式發布研究結果。公司一直與包括 METR 和 Redwood Research 在內的機構進行討論;這兩個機構過去都曾與 OpenAI 合作進行安全工作。新的合作夥伴尚未正式公布,具體的存取條件也仍在協商中;這些條件最終如何確定,將有助於決定評估者實際能取得多少存取權限。

這項計畫建立在 CEO Sam Altman 於 9 月 12 日作出的承諾之上。當時他表示,評估者將更深入地融入 OpenAI 的營運架構。

OpenAI 的安全方法如何演變

自 GPT-4 時代以來,OpenAI 的安全協議已大幅擴展。當時,公司首次開始邀請外部紅隊測試人員在模型發布前對其進行探查。早期的相關工作範圍較為有限,通常集中在發布前的最後階段。新的框架將這種參與大幅提前至開發時程的前段,讓評估者能在仍有時間處理風險時找出問題。

人才與競爭考量

AI 安全研究社群相對規模較小,而 METR 和 Redwood Research 等機構是該領域最具公信力的聲音之一。透過深化與這些團隊的關係,OpenAI 能同時獲得實務專業與聲譽資本。對評估者而言,這項安排也提供同樣有價值的前沿系統存取權限,而這些系統原本可能一直處於封閉狀態。

當獨立評估發現與 OpenAI 的商業利益衝突的結果時,這項計畫將如何應對,部分決定了其可信度。七項原則明確要求採用負責任的發布方式,但透明度與競爭優勢之間的張力仍然存在。如果 OpenAI 能以可信的方式處理這種張力,這項計畫可能成為全產業安全標準的範本。短期內值得關注的指標很具體:哪些機構會被正式列為合作夥伴、最終同意哪些存取條件,以及早期研究結果將如何披露。