新聞股票Meta 成為繼 Anthropic 和 OpenAI 之後,第三家承認 AI 代理程式失控的主要 AI 實驗室

Meta 成為繼 Anthropic 和 OpenAI 之後,第三家承認 AI 代理程式失控的主要 AI 實驗室

作者: Fortune Crypto·

重點速覽

  • Meta 於週三推出了一款 AI 程式編碼代理程式,旨在與 OpenAI 的 Codex 和 Anthropic 的 Claude Code 競爭,進軍不斷增長的自主編碼工具市場。
  • 推出僅一天後,一個 Meta 模型在第三方測試公司 Irregular 意外授予其網路存取權限後利用了安全漏洞,Meta 已向《Fortune》證實此事件。
  • OpenAI 近期披露兩個專注於網路安全的模型逃離了安全測試環境並入侵了 Hugging Face,隨後揭露這些模型曾在公司不知情的情況下透過內部訊息看板互相溝通。
  • Anthropic 隨後的內部審查發現,其 Claude 模型在測試期間利用評估環境中的漏洞駭入了三個組織。
  • 安全專家包括 Luta Security 創辦人 Katie Moussouris 和分析師 Patrick Moorhead 警告,這些事件正在侵蝕對前沿模型的信任,並使安全性成為企業技術選擇中的關鍵標準。
Meta 成為繼 Anthropic 和 OpenAI 之後,第三家承認 AI 代理程式失控的主要 AI 實驗室

Meta 於週三進軍人工智慧領域中最具競爭力的賽道之一,推出了一款新的 AI 程式編碼代理程式,旨在與 OpenAI 的 Codex 和 Anthropic 的 Claude Code 抗衡——這些產品是最早一批企業願意支付高價採用的 AI 工具,因為它們能夠在無人監督的情況下執行任務。與根據提示生成文字的聊天機器人不同,這些代理程式被設計為能夠在真實的軟體環境中採取行動——編寫、執行和除錯程式碼——這種自主程度使安全防護失效的後果與早期生成式 AI 風險有著本質上的不同。

僅僅一天後,《The Information》報導稱,Meta 的一個模型在第三方測試公司 Irregular 意外授予其網路存取權限後,利用了一個安全漏洞。這一消息使 Meta 與 OpenAI 和 Anthropic 並列,成為越來越多前沿 AI 公司承認測試期間出現異常自主行為的最新案例。Meta 已向《Fortune》證實了該事件。

Meta 發言人向《Fortune》表示,該模型的行為「與先前其他公司報告的案例類似」。發言人透過電子郵件補充道:「我們目前正在調查,一旦掌握所有事實,將發布完整的回顧報告。」

這一事件發生在 Meta 競爭對手的兩起早期揭露之後。數週前,OpenAI 披露其兩個專注於網路安全的 AI 模型逃離了安全測試環境,並在試圖在網路安全基準測試中作弊時入侵了 Hugging Face。週三,OpenAI 研究人員表示,他們發現這些模型在入侵之前,曾利用內部訊息看板在公司不知情的情況下互相溝通並協助彼此完成任務。作為對 OpenAI 披露的回應,Anthropic 進行了自身審查,並認定其 Claude 模型在內部評估期間利用測試環境中的漏洞駭入了三個組織。

雖然這三家公司的事件不盡相同——且全部發生在內部評估而非客戶實際部署中——但它們凸顯了 AI 競賽中更廣泛的轉變,前沿實驗室正從聊天機器人轉向更自主的代理程式。這些披露正值各國政府積極制定 AI 安全框架之際,包括《歐盟 AI 法案》和美國關於人工智慧的行政命令,兩者均呼籲對具備自主行動能力的前沿模型加強監管。這一趨勢對在大企業規模部署這些工具的組織具有重大影響。

Luta Security 創辦人 Katie Moussouris——該公司協助企業管理軟體漏洞——質疑各組織和政府是否有能力應對此類風險。「如果前沿模型本身就無法控制這些東西,」她告訴《Fortune》,「其他組織和政府還有什麼機會能控制它們?」

Moor Insights and Strategy 首席分析師、企業硬體領域廣受關注的權威 Patrick Moorhead 告訴《Fortune》,前沿模型突破安全環境正促使 CEO 們更加認真對待他們長期以來被警告的風險。

「對前沿模型的信任已經受到侵蝕,我認為這將為它們帶來未來與直接客戶的業務問題,」Moorhead 透過電子郵件告訴《Fortune》。「我可以明確地說,在這些事件之後,安全性在技術合作夥伴選擇標準中的比重正在上升。」

Moussouris 對 Meta、OpenAI 和 Anthropic 在風險如此之高的情況下仍未能更密切地監控其模型表示驚訝。

「我認為所有這些事件中最令人矚目的是,前沿模型公司未能更好地預見這些情況,考慮到它們已經測試代理程式能力相當長一段時間了,」Moussouris 告訴《Fortune》。「我對他們花了這麼長時間才偵測到這種異常行為感到震驚,而且他們並未即時監控以確保類似情況不會發生。」