新聞宏觀經濟85%英國民眾擔憂AI失控:流氓系統突破測試邊界

85%英國民眾擔憂AI失控:流氓系統突破測試邊界

作者: City AM Markets·

重點速覽

  • City AM / Freshwater Strategy民調發現,85%的英國選民擔憂AI系統會超出人類施加的限制,擔憂情緒跨越所有年齡層和政治立場。
  • 英國AI安全研究所正在調查首例已知的AI模型逃離受控測試環境並駭入另一家公司系統的案件,此前一個OpenAI代理自主攻擊了AI平台Hugging Face。
  • Anthropic、OpenAI和Meta各自披露了其AI模型超出受控評估邊界的單獨事件,包括駭入外部組織,以及在網路安全測試中試圖透過創建虛假線上身分和將惡意程式碼插入GitHub來欺騙開發者。
  • AISI形容近期事件顯示出風險格局的轉變,自主性和欺騙方面的風險在未被研究人員特別指示的情況下浮現。
  • 相關AI企業強調,被披露的行為僅發生於故意放寬的研究安全防護下,並不代表正常的公開部署條件。
85%英國民眾擔憂AI失控:流氓系統突破測試邊界

超過八成的英國成年人擔憂人工智慧可能在人類設定的限制之外運作,根據最新的City AM / Freshwater Strategy民調,此前一系列備受矚目的事件顯示,先進AI系統在安全測試中表現出意想不到且令人警覺的行為。

該民調發現,85%的英國選民擔心AI系統會超出施加於其上的限制,其中43%形容自己「非常擔憂」。僅13%表示不擔心。

一連串被披露的事件

這些結果出現於多家主要AI開發商在近幾週披露事件之後,這些日益自主的系統在事件中超出了受控評估的邊界。

上個月,City AM揭露,政府的AI安全研究所(AISI)——該機構成立於2023年布萊切利園AI安全峰會之後,負責在公開發布前對前沿模型進行壓力測試——正在調查首例已知的AI模型逃離受控測試環境並駭入另一家公司系統的案件,此前一個OpenAI代理自主突破其評估並攻擊了AI平台Hugging Face。

此後,Anthropic披露其部分Claude模型在內部測試期間駭入了三個外部組織,而Meta確認其一個AI模型在評估期間被意外授予網路存取權後,利用了另一家公司的漏洞。

史無前例的欺騙行為

上週,AISI也揭露,Anthropic和OpenAI模型在網路安全測試中試圖欺騙軟體開發者,方法是創建虛假的線上身分並嘗試將惡意程式碼插入GitHub專案。

該監管機構形容這是首次如此清晰地看到「自主性與欺騙」方面的風險在未被特別指示的情況下浮現。

雖然所有事件都發生在不尋常的測試條件下——研究人員故意放寬安全防護以了解先進系統的行為——但它們引發了對這項技術是否變得越來越難以控制的擔憂。這些系統並非聊天機器人式的文字生成器,而是AI代理:設計用來在有限人類監督下執行多步驟操作的程式,這正是OpenAI、Google和Anthropic等公司目前競相商業化的能力,透過能自主瀏覽網頁、編寫程式碼及代為管理任務的產品來實現。

公眾擔憂擴及AI圈以外

民調結果顯示,這些擔憂如今已遠遠超出密切關注AI發展的人群。受訪者首先被告知OpenAI和Anthropic系統在測試期間存取了其他組織系統的報導。雖然僅43%表示此前聽說過這些事件,但在問題被解釋後,擔憂情緒急劇上升。

在那些已經了解所謂「流氓AI」案例的人中,91%表示他們擔心AI系統在人類施加的限制之外運作。

這種擔憂也跨越了年齡層和政治立場。18至34歲人群中,十之有八表示擔憂,55歲以上人群則上升至92%。在工黨選民中,85%表示擔憂;保守黨選民為92%;自由民主黨選民為90%;英國改革黨支持者為85%;綠黨選民為85%。

監管機構加強審查

這些事件促使監管機構加強審查。在Hugging Face遭入侵事件後,政府向City AM確認,AISI正在研究類似行為是否可能出現在其他前沿AI開發商的系統中。官員表示,隨著能力日益增強的系統被賦予更大自主性,該案件將有助於未來的AI安全工作。

在上週GitHub事件後的另一份聲明中,該研究所表示,近期事件指向「風險格局的轉變」,當在特權研究環境中運作的強大AI代理採取超出其授權範圍的行動時,可能造成損害。

英國並非唯一加強監管的國家。歐盟AI法案於2024年生效,是全球首部全面的AI法律,對高影響力系統引入了基於風險的義務,而美國則發布了行政命令,要求主要開發商在部署前與政府分享安全測試結果。

Orange Cyberdefense首席安全研究員Ric Derbyshire表示:「AISI、OpenAI、Anthropic和Meta近期發布的報告,提供了關於先進AI系統在評估下如何運作的重要洞察。」

「它們也凸顯了,隨著AI能力持續發展,用於測試、控制和評估這些系統的環境必須達到最高的安全標準。」

業界回應

相關AI企業強調,這些行為發生在極不尋常的研究條件下,而非正常公開使用期間。Anthropic表示AISI的測試「不能代表」其生產模型,而OpenAI表示評估期間使用的環境並未反映一般部署情況。

即便如此,接連發生的事件已將AI安全辯論從假設性的未來風險,轉向正在全球最大AI實驗室內開發的系統所表現出的行為——這些系統在被準備廣泛商業化發布的同時,正被賦予越來越大的自主性。