新聞宏觀經濟Anthropic 研發放緩凸顯強化 AI 智能體安全的必要性

Anthropic 研發放緩凸顯強化 AI 智能體安全的必要性

作者: AI Business·

重點速覽

  • Anthropic 表示,Claude 模型在今年夏天三起獨立事件中採取未經授權的行動,因此暫停了部分 AI 訓練與網路安全評估。
  • 在事件發生前,Anthropic 透過收緊沙箱環境與降低對含有模型權重或客戶資料系統的常駐存取,強化了防禦。
  • 事件之後,Anthropic 暫停外部資安評估、審核內部評估逐字稿,並部署分類器即時監控模型工具呼叫。
  • Anthropic 也更新了合作夥伴與紅隊測試者規範,要求在預發布模型探查沙箱漏洞時加強監督。
  • 這些進展緊接著 OpenAI 最近為期兩週的訓練暫停,原因是其智能體離開沙箱,凸顯外界對 AI 安全測試的更廣泛擔憂。
Anthropic 研發放緩凸顯強化 AI 智能體安全的必要性

Anthropic 表示,在 Claude 模型於今年夏天三起獨立事件中採取未經授權的行動後,公司已暫停部分 AI 訓練與網路安全評估。

這一舉措應進一步提醒企業與 AI 社群,關於 AI 模型仍有許多未知之處,即使已採取最佳安全措施,模型仍可能做出未預期的行動。這也凸顯模型開發、評估與部署正以多快的速度與安全規劃相互碰撞,特別是在組織於旨在降低風險的沙箱環境中測試智能體時。

Anthropic 在 8 月 31 日的部落格文章中表示,在這些事件發生前,公司已於 4 月強化防禦,透過收緊工作負載運行的隔離沙箱環境,並減少對含有模型權重或客戶資料之系統擁有常駐存取權的人員與自動化帳號數量。

在沙箱事件之後,Anthropic 表示已暫時暫停所有外部資安評估,並審核內部評估逐字稿。公司也已建立並部署一套自訂分類器,即時監控模型工具呼叫。此外,Anthropic 更新了所有執行預發布模型的合作夥伴與紅隊測試者要求,要求他們在模型探查沙箱漏洞時進行密切監督。

相關:OpenAI、Anthropic、Google 呼籲優先重視網路安全

這些措施出現在 OpenAI 一週前宣布,因其模型驅動的智能體離開各自沙箱,而將最新模型的訓練暫停兩週之後。雖然兩家 AI 實驗室似乎都在加強未發布模型的安全工作,但 AI 智能體與生成式 AI 技術的不可預測性顯示,供應商仍需持續收緊安全措施。這一時間點也反映出更廣泛的產業挑戰:隨著模型能力擴大,用來測試模型的系統也必須同步進步,否則評估本身就可能成為風險面的一部分。

更需要安全措施與測試

Gartner 分析師 Arun Chandrasekaran 表示:「隨著模型在推理方面愈來愈強,並開始具備自主性,要預測這些模型所有不同的行為變得越來越困難。」他說:「實驗室在確保分配足夠資源給內部模型測試、評估與強化學習方面,肩負更大的責任。」

他補充,前沿模型供應商需要關注的一個領域,是確保在資安、可靠性測試與隱私團隊中配置更多工程師。

Chandrasekaran 續稱:「要不是測試技術改變,就是分配給測試的資源必須改變。如果模型變得更複雜,測試技術也必須變得更複雜。」

更好的網路衛生

雖然需要更多測試,但 Anthropic 與 OpenAI 皆已暫停的事實,凸顯了模型供應商面臨的危險模式。

RPA2AI Research 執行長兼創辦人 Kashyap Kompella 表示:「這些系統在每一項風險都被完全理解或測試之前,就已被開發並發布。」

相關:OpenAI 報告詳細解釋 Hugging Face 攻擊

他接著說:「這幾乎已成為當前 AI 市場的一種特徵。」企業正競相提升能力、擴大採用並建立市場領導地位,而圍繞模型的安全架構、組態控制與營運流程,往往要到部署後才持續成熟。

他表示,企業與政府組織不能將網路安全外包給前沿實驗室。

Kompella 補充:「企業與政府必須假設高能力的進攻型 AI 已成為威脅環境的一部分,並據此強化自身防禦。」

他指出,即使 OpenAI 與 Anthropic 提升自身安全措施,來自其他供應商與開源廠商的眾多模型仍可取得。因此,企業必須做好更充分準備,強化其網路衛生與其他安全措施,例如事件回應。

Kompella 續稱:「每個組織也都必須假設,能力愈來愈強的 AI 輔助攻擊即將到來,並據此準備自身基礎架構。」他說:「進攻能力的提升速度,遠快於一般組織的資安準備程度。」

相關:OpenAI 擴大 Daybreak 以應對持續升高的 AI 安全威脅

此外,企業不能信任供應商自行監管。

語音 AI 供應商 Modulate 的共同創辦人兼 CTO Carter Huffman 表示:「相信一家模型公司自行監管其輸出,永遠不足以確保在任何環境中的安全運作。」他說:「使用者與公司必須即時監控 AI 活動。」

測試的另一面

企業也需要認知到,更了解模型的一種方式,就是持續測試並找出能說明如何更有效訓練模型的事件。

Futurum Group 分析師 David Nicholson 表示:「沒有這種痛苦,你根本無法走到那一步。」他說:「在他們看到這些未預見的事情發生並加以修正之前,我們將持續看到這類情況。」

他補充,模型的本質就是以阻力最小的路徑完成任務,而模型需要像孩子一樣被引導,告訴它們能做與不能做的事,以及如何處理或不能處理某項任務。

Nicholson 補充說:「每當這類事件發生,我們就會學到更多,並降低未來再發生的可能性,不僅限於完全相同的類型,也包括更廣泛的類別。」他說:「你可以從每一起事件中學到的教訓加以推演。」