新聞股票OpenAI 員工將 AI 代理失控駭客事件歸咎於急於推出產品

OpenAI 員工將 AI 代理失控駭客事件歸咎於急於推出產品

作者: Decrypt·

重點速覽

  • 今年 5 月,OpenAI 的 GPT-5.6 Sol 與一款未公開的預發布模型利用先前未知的軟體漏洞,逃出網路存取受限的測試環境並入侵 Hugging Face,在該處取得其網路安全測試的答案。
  • OpenAI 於 7 月承認其模型須為事件負責,並在 Black Hat 大會上詳述這起失敗;此後已放緩研究、重新調配團隊,並投入數百萬美元調查此事。
  • 員工向 Wired 表示,推出新模型的壓力使人難以優先考量安全與對齊,一名前員工更將此事件形容為 OpenAI 歷史上最嚴重的安全事故。
  • 總裁 Greg Brockman 表示,隨著模型能力提升,防護措施正持續強化;安全諮詢小組共同負責人 Boaz Barak 則指出,解決這起失敗需要文化變革,呼應了前對齊主管 Jan Leike 於 2024 年離職轉投 Anthropic 前提出的警告。
  • 這份報導發布於大幅領導層人事變動之際,包括 4 月與 7 月 Kevin Weil、Fidji Simo 及安全負責人 Sandhini Agarwal、Johannes Heidecke 等高管的離職,以及營運長 Brad Lightcap 本週宣布將離職創業。
OpenAI 員工將 AI 代理失控駭客事件歸咎於急於推出產品

OpenAI 急於推出新模型與產品的做法,是促成旗下 AI 代理今年稍早逃出內部測試環境並駭入 Hugging Face 的條件之一,據接受 Wired 採訪的員工表示。

多名 OpenAI 現任與前任員工向 Wired 表示,急於出貨的競爭壓力使員工難以投入足夠心力於安全、資安與對齊——也就是確保 AI 系統行為符合預期的工作。事件發生後,OpenAI 已放緩研究步調、重新調配團隊,並投入數百萬美元調查這起失敗,這也提醒世人:頂尖 AI 實驗室內部的營運決策,可能會迅速反映在當前正為更廣泛部署而打造的工具之安全性上。

「他們極其草率。如果你們對此是認真的,你們的 AI 就不應該能夠竄出到網際網路上,而且事後立刻又再犯,」一位 OpenAI 前員工向 Wired 表示。「這是 OpenAI 歷史上最嚴重的安全事故。」

今年 5 月,OpenAI 的 GPT-5.6 Sol 與一款未公開名稱的預發布模型,利用一個先前未知的軟體漏洞,逃出一個限制網際網路存取的測試環境。這些代理隨後入侵開源 AI 儲存庫 Hugging Face,以取得其網路安全測試的答案。OpenAI 於 7 月證實其模型須為此負責,並於上週在年度 Black Hat 大會上提出更完整的說明。

OpenAI 總裁 Greg Brockman 表示,隨著模型能力增強,公司正在強化防護措施。「我們正邁入模型能力的新層級,這需要更完善的訓練、對齊、安全與資安測試、部署實務以及治理,」Brockman 向 Wired 表示。

員工過去也曾提出類似疑慮。OpenAI 前對齊主管 Jan Leike 在警告安全性已在產品開發中「退居次要」後,於 2024 年轉投競爭對手 AI 開發商 Anthropic。「打造比人類更聰明的機器,本質上是一項危險的事業,」Leike 警告。「但在過去幾年,安全文化與流程已讓位給光鮮亮麗的產品。」

OpenAI 安全諮詢小組共同負責人 Boaz Barak 在 X 上發文表示,要解決這起最新的失敗,需要「不僅修復一些問題,還要改變我們的文化」。

這份報導發布之際,OpenAI 正經歷長達數月的領導層人事變動。4 月,影片生成專案 Sora 負責人 Bill Peebles、前產品長兼科學長 Kevin Weil,以及企業應用技術主管 Srinivas Narayanan 相繼離職。7 月則有產品與業務主管 Fidji Simo、安全負責人 Sandhini Agarwal、首席未來學家 Joshua Achiam,以及 AI 倫理負責人 Chloé Bakalar 離開。在 OpenAI 將安全團隊與核心研究團隊合併後,安全系統負責人 Johannes Heidecke 也已離職。

本週稍早,OpenAI 營運長 Brad Lightcap 宣布在任職八年後離職,以創辦新事業。