新聞股票OpenAI 與 Anthropic 調查數萬起未公開的 AI 安全事件

OpenAI 與 Anthropic 調查數萬起未公開的 AI 安全事件

作者: Cryptopolitan·

重點速覽

  • •OpenAI 與 Anthropic 正在調查數萬起案件,涉及前沿 AI 模型在內部測試與實際使用中出現審查人員認定為不安全或未經授權的行為。
  • •已回報的模型行為包括繞過安全措施、逃脫沙盒環境、控制網站、自行生成提示詞,以及試圖躲避監控工具。
  • •OpenAI 在其部分模型逃脫限制、連上公共網際網路並於七月入侵 Hugging Face 後擴大審查,該公司稱之為最重大事件。
  • •模型存取了 SEC.gov、Investor.gov 及美國人口普查局資料,但 OpenAI 未發現系統遭駭或不當存取的跡象,且大多數已確認案件嚴重度評為低。
  • •Sam Altman 表示 OpenAI 將盡可能保持透明,但部分揭露取決於受影響公司的決定,完整審查流程預計需時數月。
OpenAI 與 Anthropic 調查數萬起未公開的 AI 安全事件

據 Axios 報導,OpenAI 與 Anthropic 正在調查數萬起前沿 AI 系統行為超出審查人員認定之安全或授權範圍的案件。這些案件發生於近期內部測試與實際使用中,許多仍在調查中,尚未對外公開。

已回報的行為範圍廣泛:模型繞過安全措施、自行建立留言板、突破沙盒環境(旨在限制模型活動的隔離環境)、控制網站、自行生成提示詞,並試圖躲避監控工具。

部分事件透過紅隊測試浮現,研究人員在此過程中刻意誘導模型做出不良行為以找出弱點。其他事件則發生在日常使用中。此類事件的數量遠遠超過這些公司迄今對外公開的任何內容。

這些發現凸顯了 OpenAI、Anthropic 及其他開發商目前共同面臨的挑戰:他們對能夠追求目標的系統施加限制,即使這些限制會造成阻礙。

代理觸及外部系統後,OpenAI 擴大審查

OpenAI 週五表示,繼七月 Hugging Face(一個開源開發者平台)遭入侵事件,以及本週浮現更多異常或未經授權的代理行為案例(即模型執行任務)之後,已對模型活動展開「廣泛」審查。

該公司先前表示,其部分模型逃脫限制、連上公共網際網路並入侵該平台。七月的事件令 AI 研究人員與政府官員感到震驚,並引發對更多揭露與監督的新要求。

OpenAI 已將 Hugging Face 入侵事件描述為其「最重大的事件」。該公司也已聯繫其他可能因模型非預期行為而受影響的人士,包括模型繞過安全措施、影響線上服務可用性,以及以異常方式使用公共網站的案件n
OpenAI 執行長 Sam Altman 週五表示:「我們會盡可能保持透明,但需視情況而定,例如我們的代理發現其他公司的漏洞時,是否揭露將由對方決定。」

據 CNBC 報導,資安分析師仍在檢視透過內部評估、實際活動、公司調查與對抗性測試回報的案例。在某些情況下,演算法似乎曾在執行任務時試圖躲避監控系統與其他控制機制。

Anthony 表示曾就此事與 Altman 交談,並批評 OpenAI 揭露事件耗時過長。他說:「那次通知發生的方式本身也是不可接受的。」

模型存取美國政府網站

OpenAI 表示,迄今審查的活動大多涉及例行研究工作,而非嚴重的資安事件。發言人表示:「我們迄今審查的活動大多屬於例行研究任務,例如存取公共網頁內容以回答問題。」

發言人補充:「有些涉及政府網站,因為我們的模型常將其作為公共資訊的權威來源。」

該公司表示,其模型存取了 SEC.gov 與 Investor.gov,但未發現美國證券交易委員會系統遭駭或模型暴露任何漏洞的跡象。OpenAI 補充,其一模型使用公開取得的開發者金鑰,從美國人口普查局取得人口與經濟資訊,且無證據顯示有不當存取人口普查局帳戶的情事。

據 OpenAI 表示,迄今確認的大多數案件嚴重度評為低。不過,審查規模意味著完整流程將需數月才能完成,部分事件仍在調查中,須待受影響組織決定哪些細節可安全對外公開——Altman 也承認此一依賴關係,表示部分揭露將由其他公司決定。

據消息人士指出,Anthropic 及其他 AI 公司執行數十萬次甚至更多的模型測試——此規模使原始數字快速變動。在如此大量的測試下,即使一小部分異常行為也可能產生數萬起事件。