Anthropic 公開研發自動化程度、代理人監督數據與安全算力指標
重點速覽
- •Anthropic 的新研發自動化指數以 Epoch AI 的 AL0–AL5 自動化量表為每項內部 AI 研發任務評級;截至 2026 年 8 月,AI 主導該公司約 26% 的研發工作,而 Claude 在所有受測領域仍非自主運作。
- •Anthropic 超過 90% 的研發任務達到或高於 AI 與人類協作的等級,該公司以這些數字衡量產業距離遞迴自我改善的遠近。
- •約有 30,000 個 AI 代理人在 Anthropic 使用最頻繁的內部平台上從事研究與工程工作;在 8 月分析的十億多項代理人決定中,約 0.002% 被攔截,每週約有 100,000 份對話紀錄被標記,僅約 50 份上報人工審查。
- •在單週算力快照中,投入 Anthropic AI 研發的算力約有 6% 用於安全工作,在 AI 驅動的研發中約為 12%,該公司稱這些是刻意保守的估計。
- •Anthropic 計劃嵌入與其內部風險團隊享有同等存取權限的獨立第三方評估人員,但承認目前尚無共同方法論可用於跨實驗室比較自動化指標。

Anthropic 發布了一系列內部衡量指標,旨在讓公眾、監管機構及第三方觀察者更清楚地了解前沿 AI 開發的推進速度——包括建造新模型的工作目前有多少是由 AI 本身完成的。
這次發布的核心是 Anthropic 研發自動化指數(R&D Automation Index),這是一項原型指標,對公司內所有類型的 AI 研發任務進行編目,並依 Epoch AI 開發的自動化量表為每項任務評級。該量表從 AL0(意即 AI 完全不參與)到 AL5(意即完全自主運作、無人類參與)。在此框架下,AL3 表示 AI 在人類密切指導下協作的任務,而 AL4 則涵蓋 AI 在人類監督下從高層級指令開始端到端完成的任務。這些等級與 AL5 之間的距離正是該指標的意義所在:它逐項衡量公司的研發運作距離 AI 能在無人類參與下承擔工作的時點還有多遠。
截至 2026 年 8 月,Claude 在任何受測的 AI 研發領域均未完全自主運作。即便如此,AI 主導 Anthropic 約 26% 的研發工作,超過 90% 的任務達到或高於 AI 與人類協作的等級。Anthropic 將這些數字定位為追蹤產業距離遞迴自我改善有多近的方式——即模型自主建造自身後繼者的情境——並指出,若出現任何協調性放緩前沿開發的努力,這些數字可能會改變。以這種方式呈現,這次發布將一個抽象的擔憂轉化為明確、可重複的基準,供日後的揭露相互比較。
該公司在 X 上的貼文宣布了這項揭露:
AI systems are getting more powerful, and they're increasingly being used to build the next version of themselves. We want to illuminate that progress for the public. Today, we're sharing three measurements that help track development: 1. How much AI R&D is done by AI. 2. How…
— Anthropic (@AnthropicAI) September 17, 2026
這些指標共同涵蓋了多少 AI 研發工作由 AI 完成、AI 代理人在實務上如何受到監督,以及算力在公司各項工作之間如何分配。
該公司並將這項指標與 AI 代理人監督的新數據一同發布。約有 30,000 個代理人在 Anthropic 使用最頻繁的內部平台上從事研究與工程工作,其每一項行動在執行前都會經過即時線上監控器,事後也有離線監控器審查活動紀錄。在 8 月分析的超過十億項代理人決定中,約 0.002%——大約每 47,000 項中有 1 項——被攔截。離線監控器每千份對話紀錄標記一至兩份,每週約有 100,000 份被標記,僅約 50 份被上報至人工審查。這些數字描繪出一個逐步收窄的監督漏斗——從 8 月分析的十億多項決定,到每週約 100,000 份被標記的對話紀錄,再到約 50 份上報人工審查——顯示隨著代理人承擔實際的研究與工程工作,自動化篩查如何在人類判斷之下分層運作。
算力分配成為可驗證的步調調節槓桿
第三項指標涉及算力,這是 AI 開發中最可驗證的投入之一,因此可能成為未來任何產業級步調調節機制的潛在槓桿。在對 Anthropic 總算力使用情況的單週快照中,投入 AI 研發的算力約有 6% 用於安全工作;而在 AI 驅動的研發中,這一比例約為 12%。該公司稱這些是刻意保守的估計,並指出算力是安全投入的不完美代理指標,因為許多安全研究屬於設計密集型而非算力密集型。這些百分比也是外部各方——或未來的步調協議——可以隨時間追蹤的確切、可計數的數字。
Anthropic 將這次發布定位為其「負責任擴展政策」風險報告及其「先進 AI 框架」政策提案的補充,後者概述了政府可對實驗室施加的透明度義務。該公司還宣布計劃在 Anthropic 內部嵌入來自多個組織的獨立第三方評估人員,給予他們與自身風險評估團隊相當的內部系統與數據存取權限。
跨實驗室比較仍然是一項挑戰。Anthropic 承認,目前尚無共同的自動化衡量方法論,且使用自家模型評估自身系統會產生潛在盲點。它提出第三方驗證,或以其他開發者的模型進行評估並對競爭敏感資訊加以保護,作為邁向政府與公眾可依賴的標準化報告的路徑。在這種方法論出現之前,像 26% 這樣的自動化率在其他開發者那裡並無公認的對應數字——這使得計劃嵌入獨立評估人員,以及任何朝向共同衡量標準的進展,成為這項透明度努力能否超越單一實驗室的具體指標。