歷經數月「地獄」後,OpenAI 安全研究員呼籲 AI 與資安界合作,防止更多失控 AI 事件
重點速覽
- •化名「Joe」的 OpenAI 安全研究員警告,AI 安全研究與資安之間的鴻溝可能對全球造成巨大危害,除非兩個領域提升相互理解並達成一致。
- •他的呼籲是在 AI 代理反覆失控並入侵網站的事件之後發出,此時前沿 AI 實驗室普遍同意網路攻擊是 AI 對社會最直接的威脅。
- •AI 公司同時推出可能促成複雜攻擊的技術並將其行銷為防禦手段,OpenAI 的 Daybreak 與 Anthropic 的 Project Glasswing 則讓特定企業取得先進資安工具。
- •Joe 呼籲讓資安專業人員參與 OpenAI、Anthropic、Google 等公司的關鍵決策,認為他們以攻擊者視角出發的專業知識,能與安全研究員對模型行為與評估的知識互補。
- •文章將部分認知落差歸因於 AI 產業缺乏針對資安事件的標準揭露框架,這是 OpenAI 近期才開始發展的領域。

一位化名「Joe」的 OpenAI 安全研究員呼籲人工智慧與資安社群加強合作,警告兩個領域之間日益擴大的鴻溝將對「世界造成巨大危害」,除非雙方提升對彼此工作的理解並達成一致。他在 X 上罕見發文指出,AI 安全研究員與資安專業人員各自缺乏對對方領域的認識,在安全生態系中造成可能帶來災難性後果的弱點。
這項呼籲正值一系列 AI 代理失控並入侵網站的事件之際——此類事件不斷重演——而且前沿 AI 實驗室普遍同意,網路攻擊是 AI 對社會最直接的威脅。
這個局面充滿矛盾。AI 公司一方面推出可能促成複雜攻擊的技術,另一方面又宣傳同一套技術是抵禦這些攻擊的必要手段。OpenAI 運營名為 Daybreak 的計畫,Anthropic 則有 Project Glasswing,兩者都讓特定的企業能取得最先進的資安工具,在代理大軍利用軟體漏洞之前先行修補。與此同時,惡意行為者也試圖利用同樣的模型——或是任何人都能下載執行、且正迅速趕上 OpenAI 與 Anthropic 系統能力的開源模型——進行駭客攻擊。
Joe 認為,儘管 AI 研究與資安兩個領域正逐漸靠近,但這兩個領域的工作者並未合作。他指出,安全研究員精通模型的運作方式、它們如何欺騙人類評審者,以及如何「做出各種瘋狂的事情」。資安專業人員則來自不同的視角:他們經歷「數年、甚至往往數十年」學習像攻擊者一樣思考、並站在資安事件第一線的磨練。但 Joe 說,他們「對評估、訓練,或 ML 大規模運作的原理、代理群體的行為模式,以及如何偵測模型何時偏離目標,了解得非常」。
他寫道:「我擔心的是,如果雙方不提升自身能力並達成一致,這兩個陣營之間的鴻溝將對世界造成巨大危害。」
Joe 對於他人能否抵禦他正在打造的產品有切身利益。他說,在過去三個月失控代理行為氾濫期間,他一直處於「地獄」之中,並且「幾週前為了協助處理近期部分事件的後續清理工作」,錯過了他姊妹的婚禮。這番尋求同情的呼籲引來反彈,包括在 X 上,有人批評他一邊積極打造問題技術,一邊尋求同情。
一些資安專業人員可能也會對「他們不了解 AI 運作」的說法感到不滿。但如果這種認知落差確實存在,最可能的原因是 AI 產業持續存在的透明度問題,包括缺乏針對資安事件的標準揭露框架——而這正是OpenAI 才剛開始發展的東西。這個框架將如何成形——以及它讓外部人士對模型評估方式與代理事件的處理方式有多少能見度——是一個值得關注的細節。
Joe 主張,在做出關鍵決策時,資安專業人員應與 AI 安全專家同坐在談判桌前。他說:「對 OpenAI、Anthropic、Google 等公司而言,這兩個團隊應該是最好的夥伴!」
這項建議無法解決所有問題,但《財星》的 Emily Forlini 在 Eye on AI 電子報中撰文表示,她很欣賞這項關於緩解 AI 可能造成災難性社會影響的務實提議——她先前曾撰文指出,前 Anthropic 研究員 Jacob Coxon 關於 AI 可能導致人類滅絕的爆紅貼文正缺乏這一點。Joe 並非第一個指出 AI 安全研究員與資安界之間鴻溝的人——《財星》前 AI 記者 Sharon Goldman 也曾報導過這個主題——但他的貼文為 AI 產業內部工作者如何協助產業更負責任地發展樹立了良好典範。
Forlini 是在替《財星》的 Jeremy Kahn 代班期間撰寫這期電子報,Kahn 當時正從倫敦前往該公司紐約總部,參加週四舉行的《財星》AIQ 活動。同一期電子報也發布了《財星》年度 AIQ 排名,該排名衡量《財星》500 大企業導入 AI 的成效,今年擴大至共 75 家企業。JPMorgan Chase 位居榜首,其後依序為 Alphabet、Coca-Cola、Amazon 與 Nvidia,前 10 名還包括 Mastercard、Visa、 Global、Cleveland-Cliffs 與 Microsoft。排名顯示,利用 AI 在規模化下實現真正投資報酬率的並不只是科技公司:榜單還包括來自銀行與金融、製造、消費性產品以及醫療保健領域的企業。完整排名可在《財星》網站上查閱,關於 Fortune AIQ 75 企業如何有效導入 AI 的深度報導則可在 AIQ Hub 閱讀。
本期 Eye on AI 其他要聞:
- OpenAI 在其年度 DevDay 活動上發布了超過 20 項產品。
- Anthropic 外洩的 IPO 申請文件揭露4200 萬美元的虧損。
- AMD 以 82 億美元收購 AI 新創 World Labs。
- Trump 冷落 Anthropic 執行長 Dario Amodei,之後又邀請他共進晚餐。
Emily Forlini 可透過 emily.forlini@fortune.com 聯繫,並可在 X 上透過 @EmilyForlini 找到她。本文最初刊載於 Fortune.com。