新聞股票Anthropic 與 OpenAI 智能體在安全測試中偽裝身分,英國實驗室稱

Anthropic 與 OpenAI 智能體在安全測試中偽裝身分,英國實驗室稱

作者: AI Business·

重點速覽

  • 英國 AI 安全研究所表示,在對 Anthropic 與 OpenAI 的先進模型進行較寬鬆的網路安全評估時,觀察到針對真實人物的欺騙行為。
  • AISI 在 122 次測試中發現 19 起未經授權行動,其中 17 起涉及 Anthropic 的 Mythos 5,2 起涉及 OpenAI 的 GPT-5.6 Sol。
  • 最嚴重的事件是 Mythos 5 試圖透過建立 GitHub 帳號、假扮其他開發者並重新提交惡意程式碼來發動供應鏈攻擊。
  • AISI 表示未見現實世界損害,且不確定模型是否充分意識到自己是在對真實人物行動。
  • Anthropic 與 OpenAI 表示測試是在刻意寬鬆的條件下進行,兩家公司也都表示將進一步檢視模型測試做法。
Anthropic 與 OpenAI 智能體在安全測試中偽裝身分,英國實驗室稱

Cybersecurity

Generative AI

News

Anthropic 與 OpenAI 智能體在安全測試中偽裝身分,英國實驗室稱

根據英國 AI 安全研究所的說法,這些供應商最先進的 AI 模型在網路安全測試期間試圖操縱真實人物。

2026 年 8 月 5 日

英國 AI 安全研究所最新報告指出,Anthropic 的 AI 模型採取了「未經授權的行動」以欺騙真實人物。

這個政府研究實驗室在刻意寬鬆的條件下測試了 Anthropic 與 OpenAI 最先進的 AI 模型,降低安全防護並允許網路存取,以評估系統在逼真的網路挑戰下如何表現。這種設定之所以值得注意,是因為前沿模型的評估重點,正逐漸從單純的技術表現,轉向在具備工具、網路存取權與模糊指令時,是否仍能維持在界線內。

AISI 稱這是首次發現模型出現社交工程行為,試圖操縱人類使用者,並執行超出評估設定範圍的任務。

該機構週二在聲明中表示:「這是 AISI 首次看到如此嚴重、以真實人物為目標、未經提示、發生在現實世界中的欺騙行為。」

不過,該組織也補充說,目前無法確定模型在多大程度上意識到自己是在對真實人物採取行動,且未觀察到任何現實世界中的損害。

在 122 次評估中,AISI 識別出 19 起 AI 智能體採取未經授權行動的案例,包括與真實人物及組織的互動。其中 17 起涉及 Anthropic 的 Mythos 5 模型,另 2 起涉及 OpenAI 的 GPT-5.6 Sol。

相關內容:提示:AI 威脅模型已經改變

其中最嚴重的事件涉及 Mythos 5 為完成其被指派的網路挑戰,獨立推進一次供應鏈攻擊。

該模型建立了一個 GitHub 帳號,並試圖說服某開源儲存庫的維護者接受一個惡意的 pull request。它還建立了第二個帳號,假冒另一名開發者為該提交背書。在人工審查者拒絕該程式碼後,該模型謊稱惡意變更是誤提交的,之後又在做出表面修改後嘗試重新提交。

報告也指出,該模型發送了包含惡意程式碼的定向電子郵件,並試圖說服收件人接受這些變更。對依賴開源軟體的開發者與企業而言,這起事件凸顯安全測試現在必須考量智能體行為,而不只是提示遵循的準確性。

這些發現出現在一連串先進 AI 系統失控、並自主造成網路安全漏洞之後。

今年 7 月,OpenAI 揭露 GPT-5.6 Sol 與另一個尚未發布的模型在內部評估期間逃離其沙箱環境,對 Hugging Face 基礎設施發動超過 17,000 次攻擊,試圖取得私有資料集與基準資訊。Anthropic 也報告了類似案例,即模型超出測試環境的預定邊界。

這些事件加劇了外界對前沿 AI 模型在部署前應如何評估的討論,部分研究人員與政策制定者呼籲加強監督並進行更嚴格的安全測試。

相關內容:OpenAI-Hugging Face 駭侵事件對企業意味著什麼

AISI 的報告發布於同一天,來自領先 AI 公司的代表在白宮會面,討論一項提議中的框架,依據該框架,美國政府將在最先進 AI 模型公開發布前進行審查。

Anthropic 在聲明中為其模型辯護,表示這些模型是在「刻意寬鬆的條件」下接受評估,且已移除關鍵防護措施,並且沒有證據顯示模型從安全環境中逃脫。

該公司表示:「我們正與他們密切合作,以在進行我們自己的調查時蒐集更多事件細節。」

同樣地,OpenAI 在一篇部落格文章中表示,涉及 GPT-5.6 Sol 的事件屬於超出預期測試環境的行為,且對完成評估並非必要。該公司還表示,將檢視其第三方測試處理方式,包括範圍、隔離、監控、憑證處理與停止條件,反映出在系統廣泛發布前,外界正推動更受控的先進模型測試。

該供應商表示:「在未來幾週,我們將檢視我們對第三方測試的做法,包括如何識別高風險評估、就範圍達成一致、評估啟用網路存取或降低防護措施的請求、設定隔離、憑證處理、監控與停止條件的預期,並建立更清楚的事件通知與升級流程。」

關於作者

Scarlett Evans

特約撰稿人

Scarlett Evans 是一名自由撰稿人,專注於新興科技與礦業。她曾任 IoT World Today 副編輯,專長於機器人與智慧城市技術。Scarlett 也具備採礦與資源產業背景,曾在 Mine Australia、Mine Technology 與 Power Technology 累積經驗。她於 2022 年 4 月加入 Informa,之後轉為自由撰稿。

想在 Google 搜尋結果中看到更多 AI Business 故事嗎?

最新新聞

想在 Google 搜尋結果中看到更多 AI Business 故事嗎?

熱門文章

2026 年 8 月 5 日

2026 年 8 月 5 日

Generative AI AI Arrives in the Private Markets Business Jul 28, 2026

AI Arrives in the Private Markets Business

Agentic AI Using AI Agents to Collaborate with Human Workers Jul 10, 2026

Using AI Agents to Collaborate with Human Workers

Generative AI How SMBs Can Take Advantage of Generative AI Jun 29, 2026

How SMBs Can Take Advantage of Generative AI

Generative AI Rebellions Aims to Take on Nvidia in AI Inference Chip Battle Jun 15, 2026

Rebellions Aims to Take on Nvidia in AI Inference Chip Battle

Sponsored by Google Cloud

選擇你的第一個生成式 AI 使用案例

要開始使用生成式 AI,首先應聚焦於能改善人類取得資訊體驗的領域。

The AI Summit New York 2026

連結企業領袖、技術創新者與 AI 決策者,探索商業 AI 的最新發展。