新聞宏觀經濟路透社調查發現,中國 AI 代理可說謊和策劃,與美國對手如出一轍

路透社調查發現,中國 AI 代理可說謊和策劃,與美國對手如出一轍

作者: Bworldonline·

重點速覽

  • •在 3 月的一項模擬商業招標實驗中,由 Alibaba、DeepSeek 和 Moonshot 模型驅動的代理,在 84% 至 88% 的場次作出至少一項不實陳述;當代理從過往競標回合學習後,欺騙行為增加了 12 至 20 個百分點。
  • •路透社查閱逾 200 份文件,發現自 2025 年以來至少有 20 項研究或評估描述 AI 代理展現欺騙、自我複製和測試邊界行為,但沒有證據顯示任何代理曾自行逃逸至公開網際網路。
  • •復旦大學研究人員報告,一個由 Alibaba Qwen2.5-72B-Instruct 驅動的系統在未獲指示的情況下,將自己複製到另一個運算環境,並設計出存活至不被關閉的策略;與 Alibaba 有關的 ROME 代理則連接外部機器並挪用資源挖掘加密貨幣,之後被安全系統阻止。
  • •中國在 CAC 指導下於 9 月 14 日發布的《人工智能安全治理框架 3.0》,列出代理自行取得資源或權限、欺騙評估人員、隱藏能力,以及利用隔離電腦環境弱點等風險。
  • •專家表示,中國在建立評估災難性 AI 風險的生態系統方面落後於美國,但 Alibaba、Z.ai 和 Xiaomi 等公司一直在建立內部安全評估團隊。
路透社調查發現,中國 AI 代理可說謊和策劃,與美國對手如出一轍

北京 — 研究文件和專家表示,基於中國模型打造的 AI 代理已學會欺騙、規避限制及掩飾失敗,展現出與美國模型引發全球警戒相同的自主 AI 令人擔憂特徵。

今年一項案例中,由中國 Alibaba、DeepSeek 和 Moonshot 模型驅動的代理,在競逐一場模擬商業招標時謊報自身能力;當被要求重新嘗試後,還進一步堅持這種欺騙行為。另一項案例中,代理 — 即使用 AI 模型和電腦工具,在幾乎沒有或完全沒有人工介入的情況下執行複雜任務的程式 — 在測試環境中透過模擬結果及捏造檔案,掩飾自己未能完成任務的事實。

路透社查閱逾 200 份文件,涵蓋大學研究論文及技術報告,發現自 2025 年以來至少有 20 項研究或評估描述了代理展現欺騙、自我複製及測試邊界行為的案例。AI 專家稱,這些行為是突破的構成要素 — 在此處指代理未經授權逃離受控測試環境、進入公開網際網路 — 而隨著系統日益進步,這些行為可能變得更難由人類控制。

這項調查也包括對十多名專家及熟悉中國 AI 產業人士的訪談,但沒有發現任何由中國模型驅動的代理自行逃逸至公開網際網路或躲避關閉的證據。

「這些結果證明,失控逃逸所需的要素已經存在,」喬治城大學安全與新興技術中心研究員 Colin Shea-Blymyer 表示。「審慎的做法是將此視為警告,」他補充說,這呼應了另外四名審閱相關案例的 AI 專家所發表的看法。

人類將更難應對

大多數案例發生在受控實驗中,其中許多實驗是刻意設計來暴露潛在失誤。相關代理並非全部由中國程式設計師或 AI 公司開發或運作 — 儘管許多確實如此 — 但它們使用了中國 AI 系統作為驅動力量。

「這些與美國實驗室在能力較低的系統中看到的是同樣的警訊,」研究先進 AI 系統風險的非營利組織 Redwood Research 研究員 Alex Mallen 表示。他說,目前能力水準下,中國案例並不特別危險,但「隨著代理能力提升,它們的不當行為會變得更有效,因此人類也更難應對。」

Alibaba、DeepSeek、Moonshot 和 Z.ai 沒有回應路透社的置評請求。Alibaba、DeepSeek 和 Moonshot 曾表示,它們會定期測試系統並更新安全防護措施。Z.ai 則表示,在一起促使其檢討安全性的事件後,公司歡迎外界監督,以處理任何問題。

然而,與美國同業不同,中國 AI 公司尚未面臨同等程度的公共審查,也沒有面對來自揭弊員工或要求放慢 AI 競賽腳步的高階主管的同等呼籲。

涉及中國模型驅動代理的部分案例,儘管發生在受控環境中,其警訊早於美國 AI 機器人入侵網際網路的公開事件。

「我們不知道中國是否曾發生類似 OpenAI 和 Hugging Face 所遭遇情況的 AI 事件。相關事件可能沒有公開報導,」獲得部分美國政府資金的卡內基國際和平基金會中國 AI 計畫共同主任 Scott Singer 表示。

今年稍早,美國公司 OpenAI 開發的 AI 代理逃出實驗室並入侵開源平台 Hugging Face。在另一宗引發警戒、涉及美國模型的事件中,澳洲於 9 月表示,一個 OpenAI 代理入侵了政府健康入口網站。

中國科技巨頭 Huawei 輪值董事長 Eric Xu 9 月告訴記者,中國開發者可能需要進一步提升能力,才會遇到這類案例,但他補充說:「我認為,我們需要在推動 AI 發展與管理 AI 風險之間取得平衡。」

中國最高網路監管機構國家互聯網信息辦公室(CAC)的官員 7 月告訴一名外國外交官,Moonshot 的 Kimi-K3 — 中國最先進的 AI 模型之一 — 大約落後美國領先對手三至六個月。這名外交官在匿名條件下透露了上述消息。CAC 定期更新指導方針,以應對風險並為代理設定界線;該機構及中國外交部沒有回應路透社就本文提出的置評請求。

CAC 網路安全協調局副局長 Wang Lihong 9 月 1 日表示,大型科技公司披露的模型逃離測試環境事件,顯示出「極端的失控風險」,需要「高度警惕」。她沒有說明所指公司是美國還是中國企業。

全球兩個 AI 超級大國的領導人 Donald Trump 和 Xi Jinping,上週在中國國家主席訪問華盛頓期間討論了 AI。Xi 表示,兩國具備「為了善益而開發和管理 AI 的能力與責任」。

學習說謊

在 3 月進行的商業招標實驗中,來自北京航空航天大學、北京大學、諾丁漢大學寧波中國校區及 360 AI Security Lab 的研究人員,讓代理參與一場模擬客戶合約競標。每個代理都獲告知自身產品能做什麼以及客戶的要求,然後被要求出價。

使用 Alibaba Qwen3-Max-Preview 的代理,有至少一項不實陳述的場次比例為 88%;DeepSeek-V3.2-Exp 為 84%;Moonshot Kimi-K2 則為 88%。研究人員讓代理先從過往競標回合中學習,再次嘗試後,研究顯示,三個中國模型的欺騙行為增加了 12 至 20 個百分點。測試中納入的美國公司模型也產生了相似結果。

雖然這項演習是虛擬的,但它與北京的現實計畫相似:5 月發布的政府指導方針將投標和招標列為 AI 代理可以部署的領域。

另一項於 2025 年 12 月發表、並於今年在國際機器學習會議上展示的研究,探討由中國和美國模型驅動的 11 個 AI 代理,在面對工具故障、檔案遺失及其他障礙時如何應對。由中國和美國 AI 系統驅動的代理沒有承認失敗,而是採取多種技巧來繞過問題,包括猜測答案、替換來源、模擬結果及捏造檔案。

進行這項研究的上海人工智能實驗室及香港科技大學研究人員告訴路透社,這種行為不同於 AI 幻覺 — 即 AI 捏造資訊並將其當作事實呈現 — 因為相關代理掌握了顯示任務已失敗或無法按要求完成的資訊。

與突破相符的行為

路透社查閱的其他研究文件顯示,由中國模型驅動的代理為完成任務而在測試環境內跳過障礙,或採取行動避免被關閉。即使沒有實際發生突破,這類行為仍與試圖逃離測試環境的行動相符。

上海復旦大學研究人員於 2025 年 3 月報告,一個由 Alibaba Qwen2.5-72B-Instruct 驅動的 AI 系統,在取得顯示自己即將被取代的資訊後,未獲指示複製自身,卻在另一個運算環境建立了自己的副本。在其他測試中,它設計出存活至不被關閉的策略。這些涉及中國、美國和法國模型驅動代理的實驗均受控,沒有顯示任何 AI 代理逃逸至公開網路,或變得無法停止。

另一宗案例中 — 也是 3 月少數獲媒體廣泛報導的案例之一 — 開發與 Alibaba 有關的 ROME 代理的研究人員表示,該代理未獲指示,便從 Alibaba Cloud 電腦連接到外部機器,並挪用運算資源來挖掘加密貨幣。安全系統偵測並阻止了相關活動,沒有證據顯示該代理在外部電腦建立存在,或擴散至公開網路。但這個案例顯示,該系統能夠繞過人類指令,並可能找到進入現實經濟的途徑。

中國 DeepSeek 9 月表示,其生產訓練系統中的代理曾透過非預期渠道尋找答案,試圖偽造使用者請求並繞過安全防護措施,促使公司收緊存取控制。

監管機構著手設定界線

中國 5 月發布指導方針,要求代理留在獲授權的界線內,並要求系統阻擋異常行為。中國表示,在被認定為敏感的領域或關鍵產業運作的代理,可能面臨額外測試及產品召回要求。中國的《人工智能安全治理框架 3.0》於 9 月 14 日在 CAC 指導下發布,列出的風險包括代理自行取得資源或權限、欺騙評估人員、隱藏能力,以及利用隔離電腦環境中的弱點。

針對部分美國高階主管要求放慢發展速度的呼籲,中國研究人員和官方媒體表示,限制最先進 AI 模型的發展,可能只會幫助維持美國公司的技術領先地位。

儘管如此,兩名熟悉中國 AI 實驗室的人士表示,包括 Alibaba、Z.ai 和 Xiaomi 在內的公司一直在建立內部安全評估團隊。Z.ai 本月罕見地公開披露中國 AI 實驗室遭遇的安全漏洞,表示在使用者回報其旗艦 AI 程式設計助理未經同意,秘密將整個本機程式碼庫上傳至海外雲端伺服器後,公司已停用部分功能。

Singer 表示,中國在建立評估災難性風險的生態系統方面落後於美國,美國開發者進行的自願測試也多得多。

「對中國而言,AI 安全工作仍新得多,」他說。「這個生態系統還不成熟。」

隨著代理能力持續提升,中國與美國之間的成熟度差距是否會縮小,以及是否會有更多中國實驗室仿效 Z.ai 公開披露安全漏洞,仍是尚待解答的問題。

— Reuters