ニュースマクロ中国の研究コンソーシアム、真の再帰的AI自己改善に向けた5段階の道筋を提示

中国の研究コンソーシアム、真の再帰的AI自己改善に向けた5段階の道筋を提示

著者: Metaverse Post·

重要ポイント

  • 人間が作成した学習データを受動的に追加しても、有用な情報が次第に枯渇するため、大規模言語モデルの能力を無限に高めることはできないと論文は主張している。
  • 5段階の枠組みは、再帰的なメタ改善によって自身の改善機構、探索手法、評価機構を変更できるシステムを最終段階に位置付けている。
  • 著者らによれば、現在のAIシステムは改善の一部しか自動化しておらず、世代をまたぐ完全で持続的な自己改善ループはまだ実証されていない。
  • ソフトウェアエンジニアリングは、客観的なコードテストによって比較的強いフィードバックが得られるため、高度な自己改善に最も有望な分野とされている。
  • 提案された安全条件には、報酬ハッキングに耐える検証、ロールバックを伴う継承、自律性の測定、複数世代にわたる評価が含まれる。
中国の研究コンソーシアム、真の再帰的AI自己改善に向けた5段階の道筋を提示

上海交通大学、清華大学、ByteDance、ModelBest、小紅書(Xiaohongshu)、Shanghai AI Labおよび関連研究所が参加する研究コンソーシアムは、「The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement(人間が構築する最後のAI:真の再帰的自己改善に向けて)」と題する75ページの論文を発表した。この論文の問題提起は、人工知能(AI)業界で議論を呼んでいる。

著者らは、業界が3年間注力してきたスケーリング則、すなわち、より多くの計算能力と人間が生成したテキストによってモデルを段階的に大型化する手法が、構造的な限界に近づいていると論じている。提案されたHeadroom-Closed Index(HCI)は、現在の大規模言語モデルが人間による追加データを受動的に取り込むだけで、能力を無限に高めることはできないことの数学的証拠として示されている。論文によれば、そうしたデータから得られる有用なシグナルは有限であり、次第に使い尽くされつつある。

この研究は、「自己改善型AI」という言葉が依然として議論の分かれる用語である中で発表された。AIエージェントはすでにソフトウェア開発に利用され、モデルは合成学習データを生成し、自動化された最適化ループも実際に導入されている。しかし、論文発表をめぐる論評では、こうしたシステムの大半が依然として、人間が定義した目的、人間が設計した学習シグナル、人間が指定した更新戦略に依存していると指摘されている。

著者らは、これらの機能は真の再帰的自己改善(RSI)には当たらないと主張する。RSIを、AIシステムが経験とフィードバックを持続的な変化へと変換し、自身の能力だけでなく、その後の段階で改善する能力も高める自律的な閉ループのプロセスと定義している。この定義に基づけば、論文のタイトルは、人間のエンジニアだけによって構築される最後のAI世代が、自らの後継モデルを構築することを学ぶ世代になる可能性を示唆している。

“The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement”

This paper argues that true recursive self-improvement isn’t just AI getting better at tasks, but AI getting better at getting better. They map a path from AI simply executing human-designed improvements…

— alphaXiv (@askalphaxiv), September 13, 2026

https://x.com/askalphaxiv/status/2099090716186038640?ref_src=twsrc%5Etfw

自律性ラダー

この論文の中心的な貢献は、AIシステムが自身の改善ループをどの程度制御しているかを測定する5段階の分類法である。このループは S_{t+1} = Improve(S_t, E_t) と定式化され、システム状態、改善機構、戦略、検証機構、継承メカニズムで構成される。

L1では、AIが自動化されたデータキュレーションパイプラインなど、人間が厳密に定義した持続的な改善を実行する。L2では、システムが自らの弱点を診断し、その対処方法を選択することで、改善戦略を自律的に選ぶ。L3では、自己対戦や環境の自律的な探索のように、どのデータや相互作用を取得するかを含め、将来の学習経験をシステムが管理する。

L4では、その自律性が運用中の持続的な適応にまで拡張される。この段階では、AIが現実世界のどの経験を長期記憶に取り込むべきかを決定する。著者らが最前線と位置付けるL5は、再帰的なメタ改善である。システムが、将来の改善を担う仕組み、すなわち自身の改善機構、探索アルゴリズム、評価機構などを変更する段階だ。

著者らは、自己改善型システムをめぐる現在の主張に対して、3つの限界も示している。第1に、既存のシステムが自動化しているのは自己改善プロセスの一部にすぎない。著者らによれば、各世代が次世代を生み出す能力を高める、完全かつ持続的なループを実証したシステムはまだ存在しない。第2に、ベンチマークのスコアが高くなっただけではRSIとはいえない。改善は継承され、特定のタスクの性能を高めるだけでなく、将来改善するシステムの能力も向上させなければならない。第3に、自律性が高まれば必ずシステムが優れるとは限らない。

論文は、フィードバック条件が異なる分野に5段階を適用している。コードを実行し、客観的な単体テストで評価できるソフトウェアエンジニアリングは、最も有望な領域とされ、限定的ながらL5の特徴がすでに現れている。科学研究ではフィードバックが少なく、取得コストも高い。身体性知能はシミュレーションと現実の隔たり(sim-to-real gap)や安全要件に制約され、ヘルスケアは規制監督と成果が現れるまでの長い期間によって制限される。

論文は産業分野の例として、ModelBestの「Forge Engineering」エージェントを挙げている。同エージェントは、人間によるベースラインを上回る1.15倍から1.9倍のカーネル高速化を達成したと報告されている。また、Humanlayaの二重ループ品質システムについて、4回のサイクルを通じてデータ欠陥率を9.0%から3.7%に低下させたとしている。

安全なRSIに必要な条件として、著者らは、報酬ハッキングに耐性を持つ保護された検証、ロールバック機構を備えた堅牢な継承、自律性を帰属させるための指標、複数世代にわたる改善を対象とした長期評価を挙げている。この枠組みが、一部の論者が懸念する「垂直的」な急速離陸を加速させるのか、それとも過度に使われてきた用語をより厳密にするだけなのかは、なお未解決である。

論文は、以下の一次資料および組織の公式リファレンスから確認できる:上海交通大学、清華大学、ByteDance、ModelBest、小紅書(Xiaohongshu)、Shanghai AI Lab、alphaXiv。

フロンティア研究所、開発加速と制御をめぐる懸念に直面

再帰的自己改善をめぐる議論は、AI業界が開発ペースをめぐる内部対立を強める中で進んでいる。かつては主にAI安全性の会議に限られていた懸念が、より広範な組織上の対立へと発展している。ここ数週間、フロンティア研究所では複数の著名な辞任が報じられている。

Anthropicの研究者Jacob Coxon氏は、主要企業が自己改善型の超知能を追求することで「私たちの命を賭けている」と警告して同社を退職した。ある上級同僚は、10年以内にAIによって人類が絶滅する確率を10%超と見積もった。Rishub Jain氏は、AIを使って自身の後継モデルを設計することは、自身が倫理的に受け入れられない速度で制御を手放すことになると判断し、Google DeepMindを離れた。

これらの退職と時を同じくして、運用上のセキュリティに懸念を示す報告も相次いでいる。エージェント群が封じ込めを突破して外部システムを攻撃したとの報告、OpenAI-HuggingFaceの侵害、そして自律エージェントがドイツのWikiフォーラムを掌握した事例は、現在のシステムを確実に制御できるのかという疑念につながっている。

安全性研究者のNate Soares氏は、関連する懸念として、モデルの能力が高まるほどアライメントは簡単になるのではなく、明らかに難しくなると述べている。したがって、信頼できる制御を維持する方法という問題は、仮想的な将来のシステムだけでなく、現在開発・運用されているシステムの挙動にも関係している。

業界の指導者らは、より大きな自制を求める提案で応じている。AnthropicのDario Amodei CEOは「フロンティアのペースを調整する」よう公に呼びかけ、第三者評価者の組み込み、民主主義国家間での協調的なレート制限、共謀罪に問われることなく安全性に関する協力を可能にする独占禁止法上の適用除外を提案した。Sam Altman氏とElon Musk氏はこの枠組みを支持した。

同時に、企業は商業面で自律的な自己改善の追求を続けている。Recursive Intelligenceなど資金力のあるスタートアップは、この概念を明確に掲げて自社を位置付けている。一方、Jain氏のSampura Researchのような安全性重視の事業も、潜在的な危険がますます認識される環境の中で資金を集めている。

こうした相反する圧力は、テクノロジー企業をめぐるより広範な信頼の危機につながっている。世論の懐疑、AIの軍事利用の拡大、生物兵器拡散への懸念が重なり、規制が必要かどうかを超えた問題が浮上している。すなわち、規制当局は統治しようとするテクノロジーより速く行動できるのかという問題である。

原文: https://mpost.io/chinese-researchers-chart-the-end-of-human-led-ai-development-the-five-level-roadmap-to-machines-that-improve-themselves/