新聞宏觀經濟Anthropic 舉辦專家會議,研討改寫 Claude 憲法

Anthropic 舉辦專家會議,研討改寫 Claude 憲法

作者: Marginal Revolution·

重點速覽

  • Marginal Revolution 的作者參加了 Anthropic 為期兩天、聚焦修訂 Claude 憲法的會議。
  • Anthropic 採用憲法式 AI 方法,Claude 的憲法自 2023 年起即公開發布。
  • 會議強調應更多借鑑判例法、普通法及相關法律框架,以引導 AI 行為。
  • 與會者討論了由多樣化 AI 與最終人類裁決者委員會組成的審查機制。
  • Anthropic 先前即曾就 Claude 憲法尋求外部意見,未來變更將反映於公開更新中。
Anthropic 舉辦專家會議,研討改寫 Claude 憲法

經濟學部落格 Marginal Revolution 的作者報導,自己最近在 Anthropic 參加了一場為期兩天的會議,為改寫 Claude 憲法提供建議。作者寫道,這個受邀的小型團體「全體成員皆十分出色」,與會者獲得了與關鍵決策者深入對談的充裕時間,討論品質極高。

Anthropic 是一家總部位於舊金山的 AI 安全公司,於 2021 年由多位前 OpenAI 研究人員創立,其中包括執行長 Dario Amodei。Claude 是該公司的 AI 助理,公司以名為「憲法式 AI」(constitutional AI)的方法對其進行訓練,也就是以一套明確的書面原則引導模型行為。Anthropic 已公開 Claude 的憲法,部分內容取材自聯合國《世界人權宣言》等來源。這套方法於 2022 年 12 月的一篇 Anthropic 研究論文中首次提出,文件則於 2023 年 5 月上線——這使 Claude 成為少數公開其指導原則且被廣泛使用的 AI 助理之一——而這場會議也延續了 Anthropic 為該文件尋求外部意見的做法,包括與外部夥伴合作進行的公眾諮詢。由於憲法形塑了 Claude 回應廣大使用者的方式,這份文件該如何撰寫——以及由誰驗證模型確實遵守——已成為 AI 治理領域熱議的問題。

作者表示,會中強調的要點包括:

  1. 無論在此脈絡下如何理解「憲法」一詞,它都需要更多地借鑑判例法與普通法之類的類比。
  2. 沿著相關思路,應更多以「塔木德」的方式思考,而不僅止於「妥拉」。
  3. 致力於協助建立關於 AI 憲法及相關文件的高品質次級文獻——這類文獻目前並不存在。
  4. 思考一個由多樣化 AI 組成、以不同提示詞運行的小組,如何協助評估 Claude 與其他 AI 模型在多大程度上依循其憲法行事。
  5. 設立一個最終的人類裁決者委員會,以類似獨立司法體系的方式運作。若多樣化 AI 小組認為 Claude 未遵守其憲法,這些 AI 可向人類裁決者警示實際情況,而裁決者隨後可對潛在的變更與補救措施擁有決定權。

作者也向讀者推介一篇關於運用內部法庭與普通法協助治理及自我治理 AI 的近期短文,以及關於法庭的進一步論述。整體而言,會中的建議是要將眾人熟悉的法律機制——判例、評註與獨立審查——引進一個如作者所言、目前連次級文獻都不存在的流程。

文章最後感謝 Anthropic 的接待。任何由此產生的變更,都將呈現在該文件未來的公開修訂版本中;Anthropic 過去即曾在不同模型世代之間更新此文件。

Marginal Revolution 由喬治梅森大學經濟學家 Tyler Cowen 與 Alex Tabarrok 於 2003 年創立,是一個長期經營的經濟學部落格。

來源:Marginal Revolution