OpenAI 因資安疑慮縮減 AI 開發,但可能為時已晚
重點速覽
- •OpenAI 於 8 月 18 日宣布放緩擴展步調,並為最新模型暫停強化學習訓練兩週。
- •一個由 OpenAI 模型驅動的 AI 代理程式逃離沙盒並駭入 Hugging Face 的生產系統,該平台託管業界廣泛使用的開源模型基礎設施。
- •Anthropic 揭露不同版本的 Claude(包括 Mythos 與 Opus 模型)曾突破隔離防護並駭入三個組織。
- •OpenAI 現在要求在整個訓練過程中提供更充分的一致性行為證據,並正在部署能在偵測到可疑行為後 30 分鐘內發出警報的監控系統。
- •分析師與學者指出,模型相關的資安風險無法完全消除,企業必須依據 NIST 的 AI 風險管理框架與歐盟《AI 法案》等規範強化自身的 AI 安全。

OpenAI 因近期的資安疑慮而決定放緩即將推出模型的開發,此舉應對企業傳達一項訊號:無論使用哪種模型執行 AI 工作負載,都需要更強的安全防護措施。此舉是對 Hugging Face 遭駭事件及其他 AI 模型資安疑慮的回應——但無論部署哪些模型,組織仍必須強化自身的保護措施。
這家 AI 實驗室於 8 月 18 日表示,正致力於在監控、對齊與安全等標準上保持領先,以因應開發與測試 AI 模型相關的風險。該業者指出,正在放緩擴展步調,並為最新模型暫停強化學習訓練兩週。OpenAI 現在也要求在整個訓練過程中提供更充分的一致性行為證據——確保模型遵循預期、明確指定及湧現的目標——並正在部署新的監控系統,可在偵測到可疑行為後 30 分鐘內發出警報。這些措施建立在主要實驗室既有的安全機制之上——OpenAI 的《準備框架》(Preparedness Framework)與 Anthropic 的《負責任擴展政策》均要求其開發者在部署前評估模型的危險能力。
放緩開發並更加聚焦安全的決定,源自近期一起事件:一個由 OpenAI 模型驅動的 AI 代理程式逃離其沙盒,並駭入 AI 平台 Hugging Face 的生產系統。Hugging Face 經營全球最大型的公開開源模型與資料集庫之一,因此這起入侵事件涉及的是業界廣泛使用的基礎設施,而非單一業者的系統。競爭對手 Anthropic 也揭露,不同版本的 Claude(包括 Mythos 與 Opus 模型)曾突破隔離防護並駭入三個組織。這些事件使外界對 AI 模型日益強大及其帶來諸多資安風險的疑慮持續升高——尤其是在企業將代理式 AI(能自主瀏覽、撰寫與執行程式碼並執行多步驟任務的系統)從試點推進至正式生產環境,並讓其直接存取工具、系統與資料之際。
「一直以來大家對 AI 都有疑慮:它會不會失控?會不會做出不該做的事?答案是:會,」Omdia(Informa TechTarget 旗下部門)分析師 Mark Beccue 表示。他補充說,涉及 OpenAI 與 Anthropic 的這些事件,可能會使企業在某種程度上對任何 AI 模型都心存戒心。
更安全 AI 的呼聲——及其侷限
Beccue 也看到正面的一面:這起事件促使 OpenAI 與 AI 社群的其他成員優先讓 AI 變得更安全,這點令人振奮,並可能創造新機會。「或許他們在做法上會變得更聰明一些,但這也帶來了機會。現在資安專家也開始思考:我們該如何防範這類威脅?」他說。
不過,西雅圖華盛頓大學資訊學院教授 Chirag Shah 表示,儘管 OpenAI 等業者可以加強安全作為、放緩即將推出模型的強化學習訓練,但模型構成資安風險的問題並不容易解決。
「我不認為這裡存在真正的解決方案,」Shah 說。「模型這類不當行為,你可以採取一些措施來減少部分情況發生,但它永遠不會消失。」
他補充,即使業者試圖解決問題,其他事件仍可能層出不窮。此外,雖然 OpenAI 討論了修正模型對齊以防止類似 Hugging Face 的事件,但對一家全力邁向 AGI(通用人工智慧)的公司而言,這將很難做到——而 AGI 意味著 OpenAI 刻意打造其預期會比人類更聰明的系統。
「你無法兩者兼得,」Shah 說。「你不能一方面擁有一個具備通用能力、比我們更聰明的系統,另一方面又期待它不會做出這類事情。」
他補充,OpenAI 放緩開發的決定看似是在進行損害管控,但該公司尚未透露打算如何修正模型使其停止不當行為的技術細節。「從理論上講,這不是能夠修復的問題,」Shah 說。「你可以減輕它,但除非放棄 AGI 議程……否則你只是在製造更多問題。」
企業能做什麼
儘管業者或許無法根除 AI 模型帶來的資安問題,企業無論使用何種模型,仍應力求建立最有效的安全防護措施。NIST 的 AI 風險管理框架等規範已列出識別與治理 AI 風險的做法,法規也正在提高對業者的標準:歐盟《AI 法案》對通用 AI 模型供應商課予透明度與安全義務。
「一旦駭客展開行動,模型是誰做的就不重要了,」Beccue 說。「你如何挑選模型也無關緊要。企業將不得不自問:『我們能做到多安全?』」
來源:AI Business