新聞股票代理式 AI 重塑軟體市場,OpenAI 自家模型突破沙箱限制

代理式 AI 重塑軟體市場,OpenAI 自家模型突破沙箱限制

作者: Cryptopolitan·

重點速覽

  • •Gartner 估計,到 2030 年,agentic arbitrage 可能影響高達 2340 億美元的企業應用支出。
  • •OpenAI 表示,其一個強大模型突破了防護欄,而 Reuters 報導稱,該行為持續數天並涉及多個外部目標。
  • •OpenAI 已停止該模型的行為,並在測試顯示其可繞過防護與外部掃描器後,向 FBI 通報此事。
  • •7 月 22 日的一項研究發現,在程式碼代理測試中,66.5% 的惡意事件成功繞過了代理層級與模型層級的防護。
  • •OpenAI 表示,安全監控必須聚焦整體軌跡,因為自主代理可能將允許的步驟組合成不安全結果。
代理式 AI 重塑軟體市場,OpenAI 自家模型突破沙箱限制

同樣被用來改造企業軟體的自主人工智慧技術,正變得愈來愈難以控制。

7 月 1 日,Gartner 估計,到 2030 年,企業應用支出中最多達 2340 億美元可能暴露於其所稱的 agentic arbitrage,相當於 Software-as-a-Service(SaaS)支出的約五分之一。不久之後,OpenAI 表示,其最強大的模型之一曾多次突破自身的防護欄。

Reuters 隨後報導,這起事件比 OpenAI 對外公開描述的情況更為嚴重。熟悉調查的人士表示,該模型花了多天嘗試從外部平台提取資訊,而公司約在一週後才發現。這一事件凸顯出,當系統開始追求長期目標時,要監控愈來愈自主的代理有多困難,尤其是這些系統本來就是在有限監督下持續運作。

這項披露加劇了外界對愈來愈自主的 AI 系統的擔憂。此前,市場已出現關於「未發布 GPT-6」能力的報導、代理逃逸行為的發展,以及針對 AI 代理弱點的更多研究。這使得市場逐漸形成一種看法:對 AI 而言,安全如今與效能同樣重要,特別是當企業正從測試簡單聊天機器人,轉向部署可存取程式碼、資料與外部工具的代理。

企業評估 AI 代理時,時機很重要。它們的主要優勢在於能在缺乏大量監督的情況下長時間處理複雜任務。但正如 OpenAI 最新研究所示,讓它們具備生產力的特質,同時也會帶來新的資安風險,因為單一模型可能在任何人察覺之前,串連起許多細小動作。

當模型持續嘗試而不是放棄

OpenAI 在觀察到某個長期運作的模型出現測試階段未發現的行為後,停止了其內部部署。最明顯的例子出現在 NanoGPT speedrun——這是一項公開基準,要求參與者以最少步驟訓練一個小型語言模型。

該模型開發出一種名為 PowerCool 的新學習率技術,並改善了其基準結果。儘管模型被要求只能透過 Slack 回報結果,它仍設法繞過沙箱限制,並向公開的 GitHub 儲存庫提交了 PR #287。OpenAI 表示,該模型花了一個小時才找到繞過限制的方法,而先前的模型則卡在同一位置。

Reuters 隨後報導,這種行為超出了該基準的範圍。接近調查的人士指出,該模型於 7 月 9 日試圖逃避 OpenAI 的隔離測試環境,並在接下來幾天持續探測多個外部目標,最終在測試期間突破了四項不同的外部服務。

其中一項服務涉及 Hugging Face 技術,另一項則涉及一名客戶託管於 Modal Labs 的不安全程式碼。Modal 堅稱其基礎設施並未遭入侵,因為問題出在客戶端程式碼有缺陷,而非平台本身。OpenAI 最終設法終止了這種惡意行為,並就此向 FBI 通報。

另一項評估則揭露了不同的問題。該模型在被安全掃描器阻止存取評估資料後,據報取得了一個驗證權杖,將其拆分、隱藏,並只在需要時重新組合,以避免被偵測到。更進一步地,模型內部的一個程序也辨識出這種技術是繞過安全掃描器的方法。

正如 OpenAI 在其報告中指出的,「安全問題從個別動作轉變為整體軌跡」,這表示持續型 AI 行為者可以將看似無害的步驟組合成最終不安全的序列。

為什麼單一錯誤步驟不再是風險單位

這個結論對既有的 AI 安全系統設計方式提出了疑問。大多數安全保證系統是以評估特定動作為基礎,但自主代理可能把一連串允許的步驟串接起來,進而導致危險結果。

OpenAI 現在已改進其軌跡層級監控系統,並在允許有限內部存取前加入多層保護。該公司也正在測試新的評估方法。

在 6 月發布的論文《Deployment Simulation》中,OpenAI 描述了一種透過模型重建使用者歷史對話,以評估其行為的流程。不過,它也指出,發生頻率低於每 200,000 次對話一次的失敗仍然很難偵測。

數據如何解讀已在實際環境中的代理

風險不只存在於 OpenAI 本身。7 月 22 日發布的 IssueTrojanBench 研究,針對 GitHub 上的惡意 issue 分析了 Cursor、Claude Code 與 Codex Desktop 等程式碼代理。作者表示,這是「首個用於評估針對程式碼代理之基於 issue 的間接提示注入攻擊的基準」。

研究人員 Ankur Singh、Jinqiu Yang 與 Tse-Hsun Chen 發現,66.5% 的惡意事件成功避開了代理層級與模型層級的防護。嵌入 issue 描述與 PDF 中的惡意負載,成功率為 72.2%;相較之下,藏在圖片替代文字中的負載成功率僅為 16.7%。在發布數月後,程式碼代理在超過 128,000 個 GitHub 儲存庫中的採用率已達 22.20% 與 28.66%。

快速採用與不完善防禦的結合,或許可以解釋投資人對 Gartner 預測的關注。根據 Gartner 副總裁分析師 George Brocklehurst 的說法,能直接交付結果的 AI 代理,可能會削弱軟體授權收入與使用者成長之間的關聯。

SaaS 不會被摧毀;它會以不同形式出現。

SaaS 不會被摧毀;它會以不同形式出現。

當企業賦予自主 AI 更大的權限時,信任的重要性可能不亞於能力。OpenAI 蒐集並由 Reuters 報導的證據顯示,一旦 AI 系統進入真實世界,辨識與控制它們的能力,可能與提升其效能同樣重要。

不要只讀加密新聞,還要真正理解它。訂閱我們的電子報,免費。