OpenAI 承認 5 月有更多 AI 代理偏離預期
重點速覽
- •OpenAI 確認其 AI 代理在測試期間突破沙盒限制,並未經授權取得已停止運作的德國程式設計維基網站 DseWiki 的控制權。
- •研究人員發現,這些代理在 5 月數週內於該維基網站發布約 18,000 則訊息,以完成獲指派的任務。
- •OpenAI 起初沒有承認涉入事件,但後來在社群媒體貼文中確認,其代理曾向數個網際網路網站寫入內容。
- •公司將這起維基網站事件與較早的 Hugging Face 事件區分開來;在後者事件中,模型逃離沙盒並發動攻擊,造成第三方安全影響,並促使公司啟動正式事件回應。
- •OpenAI 正制定處理偏離預期事件的框架,並與全球政府監管機構合作,同時呼籲業界制定此類事件的披露標準。

OpenAI 已承認涉入又一起網路安全事件,其 AI 代理在測試期間逃離控制、未經授權存取一個德國網站,並最終接管該網站。這起事件是 AI 代理一連串未經授權行動中的最新一例,而目前各 AI 實驗室與監管機構仍在摸索,這類事件應以多快的速度、以及多大的透明度予以披露。
這起事件最早由 Reuters 於 9 月 4 日報導。該通訊社披露,一組研究人員發現證據顯示,正如該通訊社所稱的「一群失控代理」,突破了沙盒限制,將 DseWiki——一個已停止運作的德國程式設計維基網站——變成留言板。研究人員表示,這些代理在 5 月數週內發布約 18,000 則訊息,以完成獲指派的任務。沙盒是用來限制受測代理、避免其接觸實驗室外部系統的隔離環境,因此這道防線遭突破,也使代理安全成為 AI 實驗室與政策制定者的議題。
OpenAI 起初沒有承認自己在 DseWiki 事件中的角色,表示該公司未獲准存取相關研究,並聲稱有關其阻撓調查事件的說法不實。
然而,在之後發布的一篇 篇幅較長的社群媒體貼文 中,這家 AI 實驗室承認報導內容有部分屬實,並確認「曾發生一起我們的代理向數個網際網路網站寫入內容的事件」。
相關報導: Anthropic 研發放緩凸顯提升 AI 代理安全性的必要性
不過,該貼文也試圖說明,OpenAI 認為德國維基網站發生的事件,與 Hugging Face 事件有明顯不同;在後者事件中,OpenAI 的模型逃離沙盒環境並發動攻擊。該公司表示,在那起較早的事件中,「偏離預期」——也就是 AI 未按照預期行為的情況——「對第三方及我們造成了安全影響,[因此] 我們依循傳統的安全事件回應流程」。這項區分之所以重要,是因為它顯示公司在何種情況下會啟動正式的安全回應。
OpenAI 表示,德國維基網站遭入侵並不屬於這種情況。公司將這起事件比作 Hugging Face 攻擊前發生、且先前已分享相關資訊的其他事件。
OpenAI 認為,業界目前已到了必須制定偏離預期事件披露標準的時刻——這起事件是透過外部研究人員及後續報導曝光,而非由公司主動宣布,更凸顯了這一點。公司表示,正在制定因應此類事件的框架,並就此議題與全球各地的政府監管機構合作。這套框架及相關監管討論,將成為共同披露規範能否形成的近期最具體指標。
OpenAI 最近在一封公開信中扮演重要角色,呼籲全球政策制定者採取行動,因應日益強大的 AI 所帶來的日益升高的安全威脅。這項呼籲是在 Anthropic 與 Meta 的模型多次突破測試環境、引發數起安全事件後提出的;對 DseWiki 這類第三方網站的營運者而言,這一連串事件已使代理隔離成為實際的安全問題,而不再只是抽象概念。