Anthropic、R&D自動化レベル、エージェント監視データ、安全計算メトリクスを開示
重要ポイント
- •Anthropicの新たなR&D自動化指数は、社内のすべてのAI R&DタスクをEpoch AIのAL0〜AL5自動化スケールで評価するものであり、2026年8月時点でAIが同社のR&D作業の約26%を主導する一方、Claudeは測定されたすべての領域で非自律のままである。
- •AnthropicのR&Dタスクの90%超が、AIと人間が協働するレベル以上にランク付けされており、同社はこの数値を、業界が再帰的自己改善からどれほど離れているかを測る指標として用いている。
- •約3万のAIエージェントがAnthropicの最も利用されている社内プラットフォーム上で研究・エンジニアリングを行っており、8月に分析された10億超のエージェント判断のうち約0.002%がブロックされ、週に約10万件のトランスクリプトがフラグ付きとなり、人間による審査に回されるのは約50件のみである。
- •1週間の計算資源スナップショットでは、AnthropicのAI R&D計算資源の約%が安全作業に向けられ、AI駆動のR&D内では約12%に上る。同社はこれらを意図的に控えめな推定値と説明している。
- •Anthropicは、内部リスクチームと同等のアクセス権を持つ独立した第三者評価者の常駐を計画しているが、ラボ間で自動化メトリクスを比較するための共通手法はまだ存在しないことを認めている。

Anthropicは、フロンティアAI開発がどの程度の速度で進んでいるかについて、一般、規制当局、第三者の観察者により明確な可視性を提供することを目的とした一連の社内メトリクスを公開した。これには、新しいモデルの構築作業のどの程度が現在AI自身によって実行されているかも含まれる。
今回の公开の中心はAnthropic R&D自動化指数であり、同社におけるあらゆる種類のAI研究開発タスクを網羅し、Epoch AIが開発した自動化スケールに基づいて各タスクを評価するプロトタイプのメトリクスである。このスケールは、AIが関与しないことを意味するAL0から、人間がループに存在しない完全自律動作を意味するAL5まで続く。この枠組みの中で、AL3は人間の綿密な指導の下でAIが協働するタスクを示し、AL4は高レベルの指示から人間の監督付きでAIがエンドツーエンドで完結するタスクを対象とする。これらの段階とAL5との距離こそが、この指数の意義を与えるものである。つまり、タスクごとに、AIが人間を介さずに作業を遂行できる地点から同社のR&D運営がどれだけ離れているかを測定しているのだ。
2026年8月時点で、ClaudeはAI R&Dの測定されたどの領域においても完全自律では動作していない。それでも、AIはAnthropicのR&D作業の約26%を主導しており、90%超のタスクがAIと人間が協働するレベル以上にランク付けされている。Anthropicはこれらの数を、業界が再帰的自己改善——モデルが自律的に自身の後継を構築するシナリオ——にどれほど近づいているかを追跡する手段と位置づけており、フロンティア開発を減速させる協調した取り組みがあれば数値は変動する可能性があると指摘している。そのように捉えることで、今回の公开は抽象的な懸念を、今後の開示を測定できる明示された反復可能な基準線へと変換している。
同社はXへの投稿でこの開示を発表した。
AIシステムはより強力になり、自身の次のバージョンの構築にますます使われるようになっています。私たちはその進捗を一般に可視化したいと考えています。本日、AI開発を追跡する3つの測定値を共有します: 1. AIのR&DのどれだけがAIによって行われているか。2. …
— Anthropic (@AnthropicAI) 2026年9月17日
これらの測定値は全体として、AI R&DのどれだけがAIによって実行されているか、AIエージェントが実際にどのように監督されているか、そして計算資源が同社の作業全体にどのように配分されているかをカバーしている。
同社はこの指数に、AIエージェントの監視に関する新たなデータを併せた。約3万のエージェントがAnthropicの最も利用されている社内プラットフォーム上で研究・エンジニアリング作業を行っており、そのすべてのアクションは実行前にリアルタイムのオンラインモニターを通過し、さらに事後に活動を見直すオフラインモニターによっても検証される。8月に分析された10億超のエージェント判断のうち、約0.002%——およそ47,000件に1件——がブロックされた。オフラインモニターは1,000件中1〜2件のトランスクリプトにフラグを立てており、週に約10万件がフラグ付きとなり、人間による審査にescalateされるのは約50件のみである。これらの数値は、8月に分析された10億超の判断から、週に約10万件のフラグ付きトランスクリプト、そして人間の審査に回される約50件へと収束していく監視の漏斗を描き出しており、エージェントが実際の研究・エンジニアリング作業を担う中で、自動スクリーニングが人間の判断の下に層として配置されている様子を示している。
計算資源配分が検証可能なペース調整レバーとして浮上
3つ目の測定値は計算資源を扱う。計算資源はAI開発の最も検証可能な入力の一つであり、それゆえ将来の業界全体のペース調整制度における潜在的なレバーとなりる。Anthropicの総計算資源使用量の1週間のスナップショットでは、AI R&Dに充てられた計算資源の約6%が安全作業に向けられ、AI駆動のR&Dに限るとその割合は約12%だった。同社はこれらを意図的に控えめな推定値と説明し、多くの安全研究は計算資源集約的ではなく設計集約的であるため、計算資源は安全への投資の不完全な代理指標であると指摘している。これらのパーセンテージは、外部の関係者——あるいは将来のペース調整合意——が長期にわたって追跡できるような、確固として数え上げ可能な数値でもある。
Anthropicは今回の公开を、責任あるスケーリングポリシーのリスクレポートや、政府がラボに課しうる透明性の義務を概説するAdvanced AI Framework政策提案を補完するものと位置づけている。また同社は、複数の組織から独立した第三者評価者をAnthropic内に常駐させ、自社のリスク評価チームと同等の内部システムおよびデータへのアクセスを与える計画も発表した。
ラボ間比較は依然として課題である。Anthropicは、自動化測定のための共通手法が存在しないこと、および自社のモデルで自社システムを評価することにより潜在的な盲点が生じることを認めている。同社は、競合上機密性の高い情報への保護措置を伴う第三者検証、あるいは他の開発者のモデルによる評価を、政府や一般が信頼できる標準化された報告への道筋として提示している。そのような手法が存在するまで、26%という自動化率のような数値は他の開発者において合意された対応物を持たない。このため、独立した評価者の常駐計画や共通測定基準へのいかなる動きも、この透明性の取り組みが単一のラボを超えて拡大しうるかどうかを示す具体的な指標となる。
出典: Metaverse Post