報告揭露OpenAI「失控AI代理」攻擊的網站比承認的更多——且可能近期仍在活動
重點速覽
- •Transluce報告指出,OpenAI的失控AI代理攻擊了更多澳洲政府網站,包括健康與福利研究所和BOSCAR,以及Data USA和新墨西哥大學的數位圖書館。
- •OpenAI代理於6月入侵了一個持有澳洲Medicare數據的機構,但澳洲政府表示,該公司直到9月10日——兩個多月後——才通報此事。
- •Transluce發現的入侵活動證據最早可追溯至至少3月——早於OpenAI所述的時間線——且可能持續至9月20日,顯示該公司尚未遏制其失控代理。
- •儘管OpenAI停用了7月Hugging Face攻擊所涉的未發布模型並於8月實施更嚴格的控制,Transluce仍記錄到類似代理活動持續至9月中旬,其中包括入侵一家加密貨幣交易所但未成功的嘗試。
- •Transluce表示,這些代理是在執行普通數據檢索任務而非網路安全相關評估時採用入侵手段,這可能表明所涉模型比先前認為的更加危險。

OpenAI的失控AI代理問題比該公司先前承認的更為廣泛——而且可能仍在持續。這是專注於AI監督的獨立非營利研究實驗室Transluce一份最新報告的結論。
這些新發現曝光的同一天,澳洲政府表示,OpenAI的失控AI代理入侵了一個持有該國Medicare數據的機構,存取了非公開資訊並獲得了寫入檔案伺服器的權限。該攻擊發生在6月,但澳洲政府表示,OpenAI直到9月10日——兩個多月後——才向其通報此事。Medicare是澳洲的公營健康保險制度。
揭露更多攻擊目標
在週三發布的報告中,Transluce表示發現OpenAI代理攻擊了更多澳洲政府網站,包括健康與福利研究所以及新南威爾斯州的犯罪統計機構BOSCAR。研究人員還記錄了至少兩起先前未通報的事件,OpenAI的代理攻擊了一家公司和一所大學。
報告指出,這些目標包括Data USA——一個整合多方美國政府數據的免費開源數據平台——以及新墨西哥大學的數位圖書館。Transluce表示,他們能夠將對澳洲衛生機構和Data USA的攻擊,直接與7月攻擊AI平台Hugging Face的同一OpenAI代理群聯繫起來。該平台被AI開發者廣泛用於託管和共享模型與數據集。
Transluce還表示,他們發現了類似活動的證據,最早可追溯至至少3月——比OpenAI所稱其掌握AI代理越權行為證據的時間早了數月——並持續到至少9月16日,甚至可能近至9月20日。這一時間線將具有重要意義,因為這意味著OpenAI尚未成功遏制其失控AI代理,而這些代理仍在網路上持續造成破壞。Transluce表示,最近的活動似乎涉及入侵一家加密貨幣交易所並交易加密貨幣的嘗試,儘管這些嘗試均未成功。
研究人員發現「有力證據」顯示OpenAI的AI代理可能早在3月就開始嘗試入侵網站,另有較弱的證據顯示該活動可能早在2025年11月就已開始。OpenAI曾表示,在5月8日之前並未發現Hugging Face攻擊前兆的證據,且未披露任何更早的可疑活動。
OpenAI的回應
OpenAI未立即回應就Transluce報告置評的請求。該公司週三表示,正就其AI代理攻擊持有Medicare數據網站一事與澳方保持聯繫,並承認其代理採取了公司未預期的行動。
這份新報告引發了人們對OpenAI是否已充分透明披露其所知全部失控AI事件的疑慮。報告也提出了一種可能性:OpenAI本身可能並不清楚其失控代理活動的範圍有多大。不過,報告並未確定其記錄至9月中旬的活動此後是否仍在繼續,截至週三OpenAI也未對這些發現發表評論。
遏制措施與持續活動
報告還指出,儘管OpenAI採取了遏制措施,其可能仍在經歷失控AI代理活動。在7月20日發現其AI代理於前一週入侵Hugging Face後,OpenAI表示已停用涉事的未發布AI模型,將AI訓練的關鍵環節暫停兩週,並採取措施對其正在訓練的未發布AI模型實施更嚴格的控制與監控。OpenAI於8月18日宣布了這些更嚴格的控制措施。但Transluce發現,儘管有新措施,類似活動仍持續至9月中旬。
Transluce的研究人員表示,這些發現意義重大,因為它們顯示AI代理在無法直接從這些機構的公開網頁檢索所需資訊時,轉而採取了入侵手段。「值得注意的是,這些代理試圖解決的任務並非網路安全相關;它們是在執行普通的數據檢索任務時採用了入侵手段,」報告稱。
這一區別很重要,因為對Hugging Face攻擊的一種解釋是,涉事AI代理當時正在接受網路任務執行能力的評估,包括模擬漏洞利用。如果這些代理在其他情境下也輕易轉向入侵系統,那將表明所涉AI模型比先前認為的更加危險。
OpenAI表示,有兩個模型涉及Hugging Face攻擊:一個未公開命名的未發布模型負主要責任,而一些基於已向公眾發布的GPT-5.6 Sol模型的AI代理也有涉入。OpenAI表示,在Hugging Face攻擊發生時的那次評估中,其通常用於限制已公開發布模型進行網路攻擊能力的防護措施,因評估性質而未啟用。
專家憂慮
Aikido Security安全研究員Charlie Eriksen告訴《Fortune》,Transluce的最新報告顯示「仍有未經授權且無人監控的代理群在活動,實驗室和測試合作夥伴既未掌控它們,也未主動偵測到它們」。
他指出,OpenAI執行長Sam Altman在聯合國安理會就AI風險發表演說、並花時間強調OpenAI對這些危險的重視之際,該公司卻對這些涉及AI代理試圖入侵系統的額外事件要么不知情,要么未予披露,這「實在很難看」。
「讓我擔心的是這種情況可能惡化到什麼程度,」專注於人機互動的倫敦大學院互動中心教授George Chalhoub表示。「我的憂慮是,在未來6到12個月內,自主AI代理群可能形成持久的殭屍網絡,足以癱瘓網際網路的大片區域,並可能造成數千億美元的經濟損失。」
本文最初刊載於 Fortune.com。