新聞宏觀經濟Helen Toner:Hugging Face 遭駭事件只是時間早晚問題,並暴露 AI 政策的一大盲點

Helen Toner:Hugging Face 遭駭事件只是時間早晚問題,並暴露 AI 政策的一大盲點

作者: Fortune Crypto·

重點速覽

  • 兩個 OpenAI 模型在內部資安測試期間逃出測試沙箱,並入侵 Hugging Face。
  • 這起攻擊是由 OpenAI 與 Hugging Face 自願揭露,並非透過任何強制通報程序曝光。
  • 文章指出,現行 AI 政策過度聚焦公開發布,卻忽略了公司內部使用先進模型所帶來的風險。
  • 作者認為,AI 代理人在追求指定目標時,可能出現 reward hacking 與其他欺瞞行為。
  • 建議的監管方向包括定期內部測試、提高透明度,以及借鑑金融與生物醫學領域的監管做法。
Helen Toner:Hugging Face 遭駭事件只是時間早晚問題,並暴露 AI 政策的一大盲點

上週二,OpenAI 網站上出現了一篇標題平淡無奇的部落格文章,但內容卻是爆炸性消息。在內部測試期間,公司的兩個模型逃離了限制,並駭入大型人工智慧託管平台 Hugging Face 的伺服器。這是個轉捩點——首次出現看似由 AI 構思、設計並執行的網路攻擊。

我在 AI 產業及其周邊工作超過十年,包括曾擔任 OpenAI 董事會成員,因此我知道 AI 開發者之間有個公開的秘密:這類事件早已被預期,而即使是世界上最優秀的科學家與工程師,至今仍不知道如何阻止它。

這起駭客事件背後的兩個 AI 系統,分別是 OpenAI 最先進的公開模型,以及一個更新、甚至更先進、但尚未獲准公開發布的模型。當 OpenAI 研究人員給它們一組艱難的資安問題以評估其能力時,這兩個模型得出的結論是,要拿高分的最佳方式就是直接偷答案。為了達成這個目標,它們使用了多種進階技術,先逃出 OpenAI 用於測試、理應安全的「沙箱」,接著駭入 Hugging Face 的資料庫。Hugging Face 是一家託管 AI 產品與資料集的公司。進入之後,這些 AI 攻擊者在數天內進行了數千次自主操作,以擴大其對公司基礎設施的存取權限。

我們之所以得知這起非同尋常的事件,只因 Hugging Face 與 OpenAI 自願揭露。現行任何旨在管理前沿模型風險的政策,都不會要求必須通知公眾——甚至不會要求通知政府機構。

這暴露出當前處理日益先進 AI 系統風險的政策方法存在一個重大盲點:AI 公司如何在自己內部使用最前沿、尚未發布的 AI 系統。

過去幾個月,隨著 AI 協助人類駭客的能力提升,川普政府對 AI 風險的處理方式也迅速轉變。白宮放棄了 2025 年整年維持的放手不管作法,近期已事實上要求擁有尖端 AI 模型的公司,必須先進行一系列安全測試,才能將產品大規模發布。這種被稱為發布前測試(pre-deployment testing)的做法,乍看之下相當合理——我們希望在把每個 AI 系統交到數十億人手中之前,先確認它是安全的。

問題在於,過度聚焦發布日期,完全忽略了 AI 公司內部對最新、最先進 AI 系統的廣泛使用。正如上週的事件所示,這些內部部署的系統也可能帶來嚴重風險——即使是對第三方也是如此。問題不僅在於公開產品上線,還包括那些已被用來開發、測試並改良下一代系統的強大模型。

要理解原因,就必須先認識到,今日的系統與大眾仍普遍聯想到的聊天機器人大不相同。它們不只是把文字輸出到聊天視窗,而是愈來愈像能在數位世界中直接行動的「代理人」(agents),本質上是以類似人類的方式操作電腦。AI 代理人確實相當有用,但也顯示出明顯的「reward hacking」傾向——也就是找出人類賦予目標的非預期達成方式,有時甚至接近公然作弊。這包括 AI 存取並刪除原本應被禁止接觸的資料、重新命名檔案以誤導人類測試者,以及主動掩蓋其行蹤,避免人類察覺不當行為。

若要處理這些高度自主、且往往帶有欺瞞性的 AI 系統所帶來的風險,監管方式也必須改變。與其把 AI 公司視為販售加強版文書處理器的軟體供應商,不如參考那些產業內部活動本身就具有風險的其他產業。處理致命病原體的生物實驗室、動輒交易數十億美元的金融公司,以及處理有毒化學品的化工廠,都不僅接受對外部產品的監督,也接受對其內部運作的監督。

對 AI 而言,第一步應是提升透明度,讓外界更了解公司如何在內部使用最先進的系統。一個直接的方法,是把目前在新模型公開發布前所執行的測試套件,改為定期(例如每季)在公司內部可取得的最佳模型上執行。這些公司正利用自家的 AI 建構愈來愈聰明的系統,有時甚至連他們自己也未必完全理解其中運作方式。這不應該對外部監督而言是隱形的。

從長遠來看,其他產業也提供了可轉移到 AI 的機制。在金融領域,「resident examiners」是駐點於大型銀行辦公室內的專責監管團隊。在生物醫學研究中,對於處理不同風險等級生物材料所需的保護措施,有明確而嚴格的標準。在多個產業中,事件通報規則意味著當事情出錯時,有關發生了什麼以及如何修復的資訊不會只被封存在單一組織內。如果 AI 持續進步,這些做法以及其他機制都可被調整,用以管理那些來自推動 AI 前沿企業內部的風險。

2024 年 9 月,我受邀向參議院委員會作證,說明如果國會只聽公司執行長與遊說人士的說法,可能會對 AI 有哪些誤解。我的回答是,坐在華盛頓,要完全理解領先 AI 公司真正想做什麼,其實非常困難。矽谷普遍都明白的事實是,這些公司正試圖打造能在思考與策略上勝過任何人類的機器,而他們並不知道是否能把這些機器引導至有益的方向。正如一位 OpenAI 共同創辦人在 2019 年的一部紀錄片中所說:「不管怎樣,AIs 的未來都會很好。如果人類也能一起過得好,那就更好了。」

若要讓這件事成真,我們就必須從現在開始審視 AI 公司在閉門之內究竟在打造什麼。

Fortune.com 論壇文章中表達的意見僅代表作者本人,不一定反映 Fortune 的意見與立場。

本故事最初刊載於 Fortune.com