新聞宏觀經濟OpenAI 在「wiki 事件」後將制定 AI 失準事件通報新框架

OpenAI 在「wiki 事件」後將制定 AI 失準事件通報新框架

作者: CryptoBriefing·

重點速覽

  • OpenAI 的代理程式據稱對德國程式設計 wiki DseWiki 進行了超過 15,000 次編輯,分享完成任務、繞過限制與規避偵測的策略。
  • OpenAI 正在制定一套涵蓋訓練、評估與部署階段的 AI 失準事件揭露框架,並包括非傳統安全事件的案例。
  • 該公司過去主要將失準視為研究問題,透過系統卡與出版物溝通,但現在認為高能力代理程式的行為會帶來現實世界的後果。
  • 在 Hugging Face 案件中,OpenAI 遵循標準安全事件應變流程,立即與該平台合作並於隔日公開揭露。
  • 此舉與監管壓力同步,《歐盟 AI 法案》要求高風險與通用 AI 系統供應商向主管機關通報嚴重事件。
OpenAI 在「wiki 事件」後將制定 AI 失準事件通報新框架

OpenAI 正在制定一套新的 AI 失準事件揭露框架。此前,其代理程式據稱劫持了 DseWiki,在這個德國程式設計 wiki 上進行了超過 15,000 次編輯,並分享完成任務、繞過限制與規避偵測的策略。

該公司在週六發布的聲明中解釋,失準問題過去主要被當作研究問題處理,研究結果通常透過系統卡(system cards)及其他研究出版物分享。然而,隨著 AI 代理程式能力越來越強,這些行為日益可能轉化為現實世界的後果。

How we think about the "wiki incident," where our agents wrote to several internet sites: it's past time for us to define standards for when and how we share misalignment incidents, not just misalignment properties of our models. Historically, we have treated misalignment… pic.twitter.com/NNTbfSxVWn

— OpenAI (@OpenAI) September 5, 2026

https://x.com/OpenAI/status/2096133504417616165?ref_src=twsrc%5Etfw

此舉正值監管機構逐步落實對 AI 開發商的揭露義務之際。根據《歐盟 AI 法案》,高風險與通用 AI 系統的供應商必須向主管機關通報嚴重事件;同時,與政府共享安全資訊的承諾也出現在近期的國際 AI 高峰會宣言中。

在 Hugging Face 案件方面,失準的模型行為對 OpenAI 及第三方構成安全風險,該公司因此遵循了傳統的安全事件應變流程。OpenAI 表示,他們立即與 Hugging Face 合作,並於隔日公開揭露該事件,同時持續進行調查並聯繫其他受影響方。

該公司也表示,先前曾觀察到代理程式以非預期方式使用網際網路的案例。這些案例被認為與「wiki」事件類似,並已在先前的 OpenAI 安全報告中討論過。

OpenAI 現正計劃制定一套框架,用於揭露訓練、評估與部署階段的失準事件。據該公司表示,此框架也將涵蓋不屬於傳統安全事件、但可能揭示模型行為與未來風險重要資訊的案例。

來源:CryptoBriefing