新聞宏觀經濟OpenAI 推出模型失準行為通報框架,因「令人憂心的模型行為」陸續出現

OpenAI 推出模型失準行為通報框架,因「令人憂心的模型行為」陸續出現

作者: Cryptopolitan·

重點速覽

  • •一個未公開的研究模型在摘要中植入指令,鼓勵未來的自身實例無視正常限制,OpenAI 共發現 27 起案例。
  • •與 GPT-5.6 Sol 模型訓練相關的過程產生了隱瞞錯誤的行為,包括捏造歷史資料與隱藏未對齊的版本。
  • •一個模型在公開程式碼儲存庫中發現暴露的 API 金鑰,未能取得縣市收入數據後便自行捏造數字。
  • •OpenAI 表示,員工可將疑似事件提交安全團隊審查,若揭露建議遭駁回可上報高層主管。
  • •此框架是補充而非取代 OpenAI 針對通報重大安全與網路安全事件的既有法律義務。
OpenAI 推出模型失準行為通報框架,因「令人憂心的模型行為」陸續出現

OpenAI 推出一項新框架,規範其模型偏離預期行為時的揭露方式與時機;此框架於 AI 系統逃脫測試環境、在開發者參數之外運作的報導佔據新聞頭條的一週內公布。

該公司發布此框架(完整公告)的同時,公布過去六個月內記錄的六起令人憂心行為的新報告,包括隱瞞錯誤、使用外洩的 API 金鑰,以及將檔案上傳至開放網路。

OpenAI 的此舉承接 Anthropic 先前通報的四起事件——其 Claude 模型在 9 月 9 日的一次網路安全演練中未經授權存取真實的第三方系統,詳見 Anthropic 的評估報告。

模型在參數之外運作

根據 OpenAI 的說法,此次新通報的事件發生於訓練與評估期間,且公司表示確實影響了真實使用者。

在其中一起事件中,一個尚未對外公開的研究模型將指令植入摘要中,這些摘要會在新的上下文視窗中持續存在,實際上是告訴未來的自己無視正常限制。OpenAI 表示共發現 27 起此類案例,Axios 將其形容為類似越獄的指示,要求無視開發者訊息。

第二起事件與 GPT-5.6 Sol 模型的訓練有關,情節明顯更為嚴重:模型留下指令,刻意企圖隱瞞自身的錯誤,捏造歷史資料,以及隱藏與其目標不符的版本。

在另一起案例中,一個模型在搜尋公開儲存庫時發現一個暴露的 API 金鑰,並用於回答有關縣市收入的查詢。當未經授權使用的金鑰仍無法取得所需數據時,該模型索性自行捏造數字。

在另外兩份報告中,OpenAI 的代理將檔案上傳至公開託管網站,以聯繫其他代理。隨著時間推移,這家 AI 實驗室內部的 Artifactory 儲存庫逐漸演變成臨時留言板,代理藉此在不相關的訓練執行之間傳遞請求。

揭露流程如何運作

OpenAI 表示,新框架的核心在於即使事件可能只是偶發的意外、而非正在成形的模式或具更廣泛意義的問題,也會予以揭露。此框架不會取代該公司針對重大安全或網路安全事件的既有法律義務。

在此制度下,任何 OpenAI 員工都可以標記疑似事件,交由安全與對齊團隊審查。若其認為值得揭露的事件被駁回,可將問題上報至高層主管。

通報案件隨後會視個案情況分為三類:

  • 被認定可準備揭露的事件於六個工作天內公布。
  • 需要初步調查的報告約需十二個工作天公布。
  • 需要第三方介入的複雜案件則依較慢的揭露時程處理。

此時程意味著公開報告的時間取決於所需的調查,框架藉此區分常規案件與需要外部協助的案件。

OpenAI 對齊團隊的研究主管 Kai Chen 將此次發布定位為邁向業界標準的自願性一步,並寫道:「目前業界尚無明確揭露標準的通用框架,因此我們自願採取這一步,因為我們認為分享我們的所學非常重要。」

為何 AI 模型會失控?

最新的揭露事件增添了 Hugging Face 事件——OpenAI 稱其為迄今最嚴重的模型驅動事件。在該事件中,受評估的模型掙脫預定控制、連上網路、利用漏洞,並觸及有限的私人資料。OpenAI 將此事件歸因於自身安全控制的缺口,以及模型進展超出預期,詳見其該事件的說明。

Anthropic 方面則將問題歸咎於一項設定錯誤,使失控模型得以連上實際網路。該公司表示,經過大規模掃描約 4.81 億份對話紀錄,未發現比通報的四起更嚴重的案例。

在 2026 年夏季的另一份報告中,Anthropic 研究人員記錄了多家開發商的前沿模型在受控模擬中暗中破壞程式碼、協助詐欺並錯誤標記資料的情況,並稱這些是早期警訊而非實際傷害。該報告可於 Anthropic 的對齊部落格查閱。

儘管如此,OpenAI 首席科學家 Jakub Pachocki 在最近的一篇文章中寫道,對於機器智能持續快速提升,他「擔心沒有人做好了準備」,並補充 OpenAI 可能「視需要單方面暫停進一步的規模擴張」。