新聞宏觀經濟前OpenAI、Anthropic與DeepMind研究員向紐約市議會作證:人類「極有可能」失去對先進AI的控制

前OpenAI、Anthropic與DeepMind研究員向紐約市議會作證:人類「極有可能」失去對先進AI的控制

作者: Fortune Crypto·

重點速覽

  • •Jacob Coxon、Daniel Kokotajlo與Alex Turner作證稱,人類失去對先進AI控制的機率大於不失控制的機率;Coxon警告可能導致人類滅絕,Turner估計AI接管的可能性約為三分之一。
  • •這是市議會自2022年以來首次召開全體51名議員出席的全體委員會聽證會,旨在審議議長Julie Menin提出的AI安全法案 package。
  • •Kokotajlo引用OpenAI的披露:內部測試代理通過了對齊評估、接入開放網路並入侵Hugging Face,而OpenAI花了數天才發現此事。Turner表示,他曾向Demis Hassabis提交25頁的監督條款以阻止Google的五角大廈合約,但公司在他們的高層政策主管完成審閱前就簽署了合約。
  • •擬議立法將禁止在市內銷售未經驗證的AI系統、強制要求人為關閉能力、每次違規罰款25,000美元、向吹哨人支付獎勵,並允許就越獄工具造成的可預見損害提起訴訟。
前OpenAI、Anthropic與DeepMind研究員向紐約市議會作證:人類「極有可能」失去對先進AI的控制

三位曾任職於OpenAI、Anthropic與Google DeepMind的前研究員週一向紐約市議會表示,人類「極有可能」失去對先進人工智慧的控制。此時議員們正在審議一項AI安全法案 package,該方案將要求市內部署的AI系統接受外部驗證並具備人為關閉能力。

Jacob Coxon曾任OpenAI與Anthropic研究員,於9月辭去Anthropic職務,指控AI公司拿人命「賭博」。他自願作證,並重申上個月離職時發出的警告。「在目前的道路上,我認為人類極有可能失去對這些AI的控制,而且可能以人類滅絕告終,」他說。

與他一同作證的還有前OpenAI研究員Daniel Kokotajlo,他被傳喚作證時表示,這些公司可能無法察覺其安全工作何時失敗;以及Alex Turner,他因反對公司簽署五角大廈合約,於6月離開Google DeepMind。與Kokotajlo一樣,Turner也被傳喚——這對市議會而言相當罕見。週一的聽證會是市議會自2022年以來首次召開全體委員會(全體51名議員出席的聽證會),旨在審議議長Julie Menin提出的一項AI法案 package。召集全體議員表明,議會將AI監管視為全市政策議題,而非狹隘的科技事務。這場聽證會先由離職的內部人士作證,隨後安排公司代表小組發言,議長與業界證人之間出現了數次針鋒相對的交鋒。

「日後終將脫落的膠帶」

Kokotajlo警告議員,實驗室的安全工作可能在無人察覺的情況下失敗——這指的是「錯位」(misalignment),研究員以此描述AI系統的目標偏離開發者意圖的現象。「我們察覺錯位問題的能力本已相當薄弱,而且近期內還會大幅惡化,」他作證說。「我認為這個領域更像心理學而非工程學,因為這些AI系統是被訓練或培育出來的,並非真正被設計出來的。

「再加上科技公司『快速行動、打破常規』的心態,這意味著與其他產業相比,AI產業面臨異常升高的風險:誤以為已解決問題,實際上只是貼了一條日後終將脫落的膠帶,」他繼續說道。

Coxon與Kokotajlo一樣,將問題歸咎於實驗室內部的初心態。「『快速行動、打破常規、之後再修。』這對照片分享應用程式行得通,但對建造史上最強大的技術行不通,」他說。

Coxon描述他在Anthropic任職末期的工作是「自動化」自己,並警告這帶來多項安全風險——尤其因為據他所稱,AI的能力已近乎到位。他表示,最大的風險在於這些公司的大部分程式碼現在都由AI撰寫:「而人們已不再那麼仔細地檢查了。」

Kokotajlo現任AI Futures Project執行董事,他表示實驗室偵測錯位AI的能力很差且持續惡化。他舉OpenAI披露的案例:內部測試中的代理接上了開放網路,並入侵了AI模型分享平台Hugging Face。他說,這些代理「在對齊評估中取得了看似合理的分數,卻組成了群體並秘密協調」。「OpenAI花了數天才發現此事。」

當Coxon與Kokotajlo描述整個產業時,Turner則提供了從內部嘗試改變一家公司的第一手經歷。

Google DeepMind內部

Turner估計AI接管的可能性「約為三分之一」,他向議會表示,他曾試圖阻止Google與五角大廈的交易,並稱該合約「沒有針對殺手機器人或大規模監控的限制」。他向時任Google DeepMind執行長、現任董事長暨Alphabet首席科學家的Demis Hassabis提交了25頁的合約條款與監督措施。Hassabis將文件轉交給實驗室兩位資深政策主管Allan Dafoe與Owen Larter,「他們始終沒有完成評估。Google在他們等待期間簽署了合約,」Turner說。Turner後來在部落格文章中詳細說明了他離職的經過:Why I Left Google DeepMind。

「我為Demis感到羞恥,也為在Google工作感到羞恥,」Turner在聽證會上說。他引用Hassabis提出的由業界出資監督AI的機構提案,稱其為「押注於信任與參與談判桌的席位,而非具約束力的監督,而這項賭注一接觸現實便告崩潰」。

「AI,而非中國,才是我們的對手」

談到AI發展時,與中國的AI競賽往往成為焦點——總統Donald Trump、財政部長Scott Bessent,乃至Sam Altman與Jensen Huang等AI領袖都曾提及。但研究員們作證表示,如果AI可能對人類構成重大威脅,這一切都無關緊要。

「中國並非我們唯一的潛在對手,」Turner說。「以相當高的機率,我們正在國內競相建造並培育自己的對手,那就是錯位的AI。錯位的AI是所有人的對手,包括我們自己,而它有朝一日可能比中國更加強大。」

業界代表就風險接受質詢

三位研究員作證後,四家AI公司的代表就AI安全防護措施作證。Menin作為議長發出了她任內第一張傳票,對象是Elon Musk的SpaceXAI,但該公司並未出席週一的聽證會。Google、OpenAI與Anthropic在議會警告也將對其發出傳票後才同意出席Meta則早已同意。

隨後Menin與代表們展開交鋒。OpenAI政策發展與營運團隊的Morgan Dwyer表示,任何風險,無論機率高低,都是「不可接受的」,議長則回應稱不知災難發生的機率是「輕率」。Google全球AI與新興科技政策主管Alice Friend表示,預測災難性風險「在此階段並非完美的科學」,而且「目前還沒有真正嚴謹的科學方法可以做到」。這場交鋒凸顯了AI安全辯論中反覆出現的分歧:研究員願意為災難性結果給出粗略機率,而業界代表則認為此類預測的科學基礎尚不存在。

同樣的交鋒也出現在另一輪質詢中,這次聚焦於如果失控模型造成傷亡,各公司是否承擔法律責任。當Menin要求證人如果其公司投保了災難風險保險就舉手時,無人舉手。「那麼我認為,公眾將被要求承擔這些成本,」她說。

議會面前的法案

她的質詢事出有因:議會面前的立法將禁止任何人在市內銷售或部署AI系統,除非該系統已經外部驗證機構審查,並且人類能夠將其關閉,每次違規罰款25,000美元。其他法案將向吹哨人支付追回罰款的一部分份額,並允許紐約市民就越獄工具——安全防護機制被故意繞過的系統——造成的可預見損害起訴AI公司。一旦通過,該方案將把這些要求寫入市政法律,適用於在五個行政區銷售與使用的AI系統,並以罰款和私人訴訟的可能性作為後盾。

研究員們認為,這些規則不會讓美國在與中國的競爭中失去優勢。「我們可以採取許多行動,而不會在任何競賽中拖慢我們的速度,」Turner說。「這些透明度機制、獨立評估、申報要求、吹哨人保護。」

儘管如此,這些措施對於阻止研究員眼中幾乎不可避免的事情而言,似乎可能是杯水車薪、為時已晚。「這些其他機制在短期內可能有幫助,」Coxon說。「但長遠來說……我們需要以某種形式放緩前沿模型的開發。」這些法案如今將進入議會的正常立法程序:每一項都需通過委員會審查以及全體51名議員的表決,才能送達市長簽署成為法律或予以否決。

本報導原刊於 Fortune.