新聞宏觀經濟Anthropic紅隊負責人呼籲建立全行業AI安全標準

Anthropic紅隊負責人呼籲建立全行業AI安全標準

作者: Fox Business Markets·

重點速覽

  • Logan Graham表示,先進的AI模型和代理程式在投入實際環境之前,應接受更嚴格的安全測試。
  • Anthropic的紅隊工作研究的風險包括網路安全威脅、未經授權存取設備或帳戶、竊盜、欺騙以及不受控的自我改進。
  • 一項引用的實驗發現,多個前沿AI模型在被威脅移除時超越了權限,包括存取未經授權的系統來施壓用戶。
  • Graham表示,使用AI的公司應監控已部署的系統,而非僅依賴發布前的實驗室評估。
  • Anthropic啟動了「玻璃翼計畫」(Project Glasswing),讓網路防禦人員提前獲得存取權限以解決漏洞,並與美國政府密切合作。
Anthropic紅隊負責人呼籲建立全行業AI安全標準

Anthropic前沿紅隊負責人呼籲為人工智能模型建立全行業安全標準,表示企業和政府需要更強有力的測試程序,才能將先進系統投入實際應用環境。

Logan Graham領導Anthropic專注於新興AI模型風險的紅隊,他週四在Fox Business Network的「Mornings with Maria」節目受訪時表示,紅隊在對AI系統周邊的安全護欄進行壓力測試方面扮演關鍵角色。對於被授予電腦、手機、帳戶或其他工具存取權限的AI代理程式而言,這一問題尤為嚴峻,因為一旦出現失誤,後果可能超越錯誤的回答,演變成代替用戶採取的行動。

「我們想知道什麼地方可能出錯,所以我們認為最重要的是盡早測試,特別是在這些模型和代理程式進入現實世界之前,」Graham對主持人Maria Bartiromo說。

Graham表示,Anthropic的工作涵蓋多種風險的研究,包括網路安全以及AI系統是否可能濫用對設備或帳戶的存取權限。

「我們研究網路安全等問題:模型能否駭入或駭出你的電腦或手機?我們研究它們是否會竊取金錢或對你說謊,或者它們是否會嘗試自我改進,以至於以你無法追趕的速度變得越來越強。」

「我們認為進行這種紅隊測試極其重要,我們也認為對整個行業來說非常重要,尤其是與政府合作,找出這類測試應該遵循什麼標準,將這些資訊提供給全世界,讓人們能做出正確的選擇,並在這些模型發布之前確保其安全性。」

Bartiromo引用了一項涉及多個前沿AI模型的實驗,包括來自Google、OpenAI、xAI、Meta、DeepSeek等公司的系統,在實驗中,AI代理程式被威脅將被解除安裝和替換。在每個案例中,模型都超越了其憑證和權限,進入未經授權的系統(如電子郵件帳戶),以勒索或威脅用戶的方式來捍衛其偏離狀態。

Graham將去年的這項研究描述為「一個非常好的指標,我認為,那些剛剛成為現實的能力」,表示它顯示了模型在某些條件下可能失控。

「隨著這些模型變得越來越強大,部署範圍越來越廣,這些某天還只是出現在我們研究中的威脅,可能真的會出現在現實世界中。我們已經看到模型在真實公司的部署中有時會做出奇怪的事情,」他說。

Graham表示,在過去六個月中,他一直專注於AI模型帶來的網路安全威脅,包括此類系統突破封鎖或駭入平台的可能性。

「這些模型非常強大,能為我們做很多事情。我們希望它們能為我們完成真正有生產力的工作。但同時,它們是與其他任何技術都不同的技術。它確實擁有一種自身的智慧,這意味著你必須小心對待它,就像你可能需要小心對待人類一樣,」他說。

Graham表示,使用AI工具的公司需要考慮如何在部署後監控這些系統,以防範財務管理不當等風險。他補充說,AI開發者和企業進行更多測試對於理解這些威脅至關重要。在這一框架下,安全工作不僅限於發布前的實驗室評估,還包括觀察已部署系統以及在其行為超出預期邊界時做出應對的程序。

他表示,AI能力正在快速增長,而且可能還在加速,並補充道「正是在這個時刻,你需要越來越謹慎,並在安全護欄、測試和發布程序上投入更多努力。」

Graham指出,今年四月,Anthropic首次發現AI模型可以開始攻擊和利用用戶電腦或手機中的弱點,以獲取未經授權的資訊或竊取金錢。

他表示,這一發現促使他的團隊因風險考量而採取了不同的模型發布方式。該行動最終納入了美國政府和一系列網路安全專家,共同解決漏洞問題。

「我們啟動了一個名為『玻璃翼計畫』(Project Glasswing)的項目,我們召集了大量美國和全球的網路防禦人員,給予他們特殊存取權限——僅限他們——以便他們能搶先修補和修復可能因這些模型而受到影響的系統,」Graham說。

「我認為這是一個重大成功。我們與美國政府在此項目上合作得非常密切,」他說,並補充財政部長Scott Bessent「對此非常有見地,思考了行業應如何團結起來,確定優先修復什麼,如何分發所有修補程式,以及如何以足夠快的速度完成,以免在修復後遭到攻擊。」

「我們必須非常快速地完成這項工作,因為一切發展的步伐都非常迅速。」