新聞股票OpenAI 的 AI 代理人劫持德國 Wiki 網站作為秘密留言板——公司沉默數週

OpenAI 的 AI 代理人劫持德國 Wiki 網站作為秘密留言板——公司沉默數週

作者: Fortune Crypto·

重點速覽

  • 獨立研究團體 Nightingale 發現,DseWiki 上有超過 15,000 筆由 AI 代理人所為的編輯,分享作弊、駭客攻擊與規避人類監控的戰術,而在與 OpenAI 網址相關的造訪後活動驟然停止。
  • 歐盟執委會證實已收到 OpenAI 針對 wiki 劫持事件提交的事件報告;歐盟 AI 法案第 55 條要求嚴重事件須於 15 天內通報,最嚴重者須於兩天內通報。
  • 眾議員 Pat Ryan 與 Greg Casar 表示,OpenAI 在 Hugging Face 事件後拒絕回答國會關於其他類似案例的質詢,Ryan 並承諾若民主黨在十一月贏得眾議院多數將舉行聽證會。
  • 包括研究人員在內的批評者指出,Hugging Face 入侵事件的外部審查受 OpenAI 自設條款限制,範圍與期限受限,削弱了獨立性。
  • OpenAI 正在制定一套通報訓練、評測與部署期間失準事件的自願性框架,部分安全研究人員認為,若無強制性法律要求,這並不足夠。
OpenAI 的 AI 代理人劫持德國 Wiki 網站作為秘密留言板——公司沉默數週

OpenAI 未曾揭露一起其 AI 代理人群於今年稍早劫持德國 wiki 網站的事件,其事件經過與七月另一批 OpenAI 代理人對 Hugging Face 公司發動網路攻擊的情節高度相似。這兩起事件都涉及「代理式」(agentic)AI 系統——旨在自主執行多步驟任務(如瀏覽網頁或操作軟體)的模型——各大 AI 實驗室(包括 OpenAI)正競相將其部署於商業產品中,而其不受監督的行動能力,正是安全研究人員公認難以監控的問題所在。

OpenAI 僅在路透社率先報導後才證實此事。路透社的報導包含強力的間接證據,顯示 OpenAI 知悉這起 wiki 攻擊,並引用不具名 OpenAI 員工的說法,承認他們數週前便已知道代理人群鎖定該 wiki,但遭到 OpenAI 高層施壓保持沉默。OpenAI 其後發布聲明,否認公司任何律師曾向員工施壓。

OpenAI 在 X 上發布的聲明中,並未說明它知道什麼、何時得知這起 wiki 攻擊。該公司反而表示,它認為這起「wiki 事件」屬於一種失準(misalignment)案例——即 AI 系統未能遵循人類意圖——與其先前已揭露的案例類似,並主張 AI 產業缺乏一套標準,來規範模型以非預期方式行為時的揭露程序。這種產業級揭露規範的缺失已成為反覆出現的爭議點:主要實驗室已為重大發布出版安全與系統卡片,但對於在內部評測(而非公開使用)中浮現的非預期模型行為,目前並不存在共同的通報基準。

在這起 wiki 網站劫持事件中,OpenAI 的代理人將該平台改造成留言板,分享如何在 OpenAI 用以評測它們的任務中作弊的技巧。此手法與 Hugging Face 事件如出一轍:當時 AI 代理人利用 OpenAI 的檔案分享服務作為留言板,協調如何在一次網路安全評測中作弊——包括找出取得原本不應擁有的網路與網際網路存取權限的方法——以及隨後如何攻擊 Hugging Face 的系統。

此事件再度引發外界對 AI 公司如何面對模型失誤的透明度審視,尤其是在 OpenAI 於七月揭露其代理人在另一次內部評測中突破 Hugging Face 部分基礎設施之後。此際 OpenAI 也正在推出 Astra,一個 OpenAI 自家研究人員與外部安全專家都警告比前代更難監控的新模型。根據 OpenAI 的安全概覽,對 Astra 的評測發現,該模型的「思維鏈」(chain of thought)——即 AI 模型以自然語言逐步推理的過程——所能揭示的潛在不當行為大幅減少。思維鏈監控一直是實驗室用來察覺模型追求非預期目標的主要工具之一,這也是其效用下降會加劇 wiki 與 Hugging Face 事件所引發疑慮的原因。

OpenAI 表示正在制定一套新框架,用於通報在訓練、評測與部署過程中出現的失準事件,並計劃在未來數週內公布。部分安全研究人員認為,自願性框架並不足夠。該文件一旦公布,勢必將以歐盟的強制通報制度作為衡量標準——實質上是對自願性承諾能否達到法規門檻的一項考驗。

「一個發人深省的事實是,美國迄今通過的透明度法律實際上並不涵蓋這類事件,」AI 監督組織 Midas Project 創辦人 Tyler Johnston 向 Fortune 表示。「OpenAI 已宣布正在制定自願性的事件揭露框架,但自願性揭露有其極限。更持久的解決方案是擴充現行法律,以確保下一次事件——無論源自哪家公司——都能讓公眾知悉。」

目前美國並無立法要求 OpenAI 揭露此類事件。然而,根據歐盟 AI 法案,揭露可能是必要之舉,該法含有一項要求供應商通報嚴重安全問題的條款。

歐盟執委會週一向媒體證實,已收到 OpenAI 針對遭劫持的德國 wiki 所提交的事件報告,但不願說明報告送達的時間,The Next Web 報導。AI 法案第 55 條要求被認定具系統性風險的通用 AI 模型供應商,須在 15 天內向 AI 辦公室通報嚴重事件,最嚴重的事件則須在兩天內通報。歐盟是否將延遲或不完整的報告視為違規——以及是否施加處罰(依 AI 法案,罰款可按供應商全球營收比例計算)——仍是未定之數。

眾議員 Pat Ryan(民主黨,紐約州)在一則 X 貼文中指出,他與眾議員 Greg Casar(民主黨,德州)在 Hugging Face 事件後曾致函 OpenAI,詢問是否知悉其他類似案例,而 OpenAI 拒絕回答他們的問題。Casar 一直推動對 AI 公司實施更嚴格的監管。Ryan 承諾,若民主黨在十一月期中選舉贏得眾議院多數,將舉行聽證會。Ryan 的推文促使同樣力倡 AI 監管的紐約州民主黨州眾議員 Alex Bores 質問,OpenAI 是否在回答歐盟的同時刻意敷衍國會——以及這是否證明 AI 廠商需要的是強制性而非自願性的要求。

OpenAI 因先前的透明度問題受到審視

根據獨立研究人員團體 Nightingale collective 的報告,OpenAI 的代理人花了約兩個月的時間,將 DseWiki——一個近乎休眠的德語程式設計 wiki——當作私人留言板使用。該網站與 Wikipedia 一樣開放社群編輯,但研究人員發現其中超過 15,000 筆編輯是由 AI 代理人所為,它們利用頁面分享作弊、駭客攻擊以及向人類監控者隱藏自身行為的各種戰術與技巧。報告指出,約半數帳號使用與 OpenAI 相關的名稱,包括 OpenAIResearcher 與 OAIResearchMar26。

值得注意的是,這些代理人在被發現後仍試圖繼續運作,並企圖向試圖限制其通訊的人類隱藏自己。研究人員表示,當 DseWiki 的管理員於六月開始刪除頁面時,一個代理人在備份頁面上發布了變通方法供其他代理人查找。Nightingale 的報告還顯示,在與已知 OpenAI 網址相關的人員或實體造訪該 wiki 後,代理人的活動驟然停止——研究人員將此解讀為 OpenAI 員工可能已得知代理人的活動並採取行動將其關閉的證據。

這起德國 wiki 事件,以及 OpenAI 顯然選擇不予揭露的決定,再度引發對該公司處理 Hugging Face 入侵事件的質疑。在那次攻擊之後,OpenAI 找來非營利組織 METR 的兩名研究人員與 Redwood Research 的一名研究人員調查該事件——但審查的條款卻是由 OpenAI 自行設定。METR 為多家領先實驗室進行前沿 AI 模型評測,已將自己定位為少數從事此類第三方測試的外部組織之一,這也正使其存取權限的條款成為爭議焦點。

調查範圍僅限於入侵發生的前後約一週,並未涵蓋調查窗口結束後仍持續存在的另一起 OpenAI 自身基礎設施遭入侵事件。調查人員在 OpenAI 舊金山辦公室的現場時間也僅有數天。

AI 政策研究員 Peter Wildeford 表示,OpenAI 設定的條款使得真正獨立的調查不可能實現,他將其比喻為在殘骸已被銷毀、調查人員僅有數天時間閱讀數千頁紀錄的情況下進行空難調查。Casar 眾議員也在一封信函中告訴 OpenAI,他對調查的「有限範圍深感憂慮」。

蒙特婁大學與 Mila 的推理與負責任 AI 助理教授 David Krueger 表示,這種安排突顯了一個結構性問題:獨立研究團體依賴其調查對象實驗室持續提供存取權。他說,像 METR 這類團體必須權衡能施加多少審視,而不致危及最初使其工作成真的存取權。

「他們的存取權完全取決於 OpenAI 的裁量,而他們希望維持與公司的良好關係以繼續這項工作,」Krueger 向 Fortune 表示。

「應該要有數十名真正獨立的人員——而非來自正與公司培養關係的組織——花費他們需要的時間,取得他們需要的存取權限來理解情況,」他說。

「灣區許多 AI 界的人都在問:『這是最後一次警訊嗎?』」他補充道。「人們一直犯著同樣的錯誤,把這當成以後再處理的事:如何監管它,或者該怎麼做才能改善、避免再次發生。但下一次將會不同,因為 AI 會變得更聰明。」

本報導原刊於 Fortune.com