新闻宏观经济中国研究团队提出真正递归式 AI 自我改进的五级路径

中国研究团队提出真正递归式 AI 自我改进的五级路径

作者: Metaverse Post·

要点速览

  • 论文认为,由于可利用信息日益枯竭,被动增加人类创作的训练数据无法无限提升大型语言模型的能力。
  • 论文提出的五级框架最终指向能够通过递归式元改进修改自身改进器、搜索方法或评估器的系统。
  • 作者表示,当前 AI 系统只能自动化改进过程的一部分,尚未展示完整且持续的代际自我改进闭环。
  • 由于客观代码测试能够提供相对充分的反馈,软件工程被认为是高级自我改进最具潜力的领域。
  • 论文提出的安全条件包括抵御奖励投机的验证机制、支持回滚的继承机制、自主性测量,以及跨多个改进世代的评估。
中国研究团队提出真正递归式 AI 自我改进的五级路径

一个由上海交通大学、清华大学、ByteDance、ModelBest、小红书、上海 AI Lab 及其附属实验室组成的研究联盟,发布了一篇题为“人类制造的最后一个 AI:迈向真正的递归式自我改进”的 75 页论文。该论文的表述方式已在人工智能领域引发讨论。

作者认为,行业过去三年对扩展定律的关注——通过更多算力和人类生成文本构建规模不断扩大的模型——正接近结构性极限。论文提出的 Headroom-Closed Index(HCI)被作为数学证据,说明当前大型语言模型无法仅通过被动吸收更多人类创作材料而无限提升能力。论文称,这类数据中可利用的信号是有限的,并且正日益枯竭。

这项研究发布之际,“自我改进型 AI”仍是一个存在争议的术语。AI 智能体已经被用于软件开发,模型能够生成合成训练数据,自动化优化闭环也已投入实际应用。然而,论文发布后的评论指出,大多数此类系统仍然依赖人类定义的目标、人类设计的学习信号以及人类指定的更新策略。

作者认为,这些能力并不等同于真正的递归式自我改进(RSI)。他们将 RSI 定义为一种自主的闭环过程:AI 系统将经验和反馈转化为持续性变化,不仅提升自身能力,也提升其在后续轮次中的改进能力。按照这一定义,论文标题暗示,最后一代完全由人类工程师构建的 AI,可能正是学会制造其后继者的那一代。

“The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement”

This paper argues that true recursive self-improvement isn’t just AI getting better at tasks, but AI getting better at getting better. They map a path from AI simply executing human-designed improvements…

— alphaXiv (@askalphaxiv), September 13, 2026

https://x.com/askalphaxiv/status/2099090716186038640?ref_src=twsrc%5Etfw

自主性阶梯

论文的核心贡献是提出一个五级分类体系,用于衡量 AI 系统对自身改进闭环拥有多大程度的控制权。该闭环被形式化为 S_{t+1} = Improve(S_t, E_t),包括系统状态、改进器、策略、验证器和继承机制。

在 L1,AI 执行由人类严格定义的持续性改进,例如自动化数据整理流程。在 L2,系统能够自主选择改进策略,通过诊断自身弱点来决定应如何应对。L3 赋予系统对未来学习经历的控制权,包括决定获取哪些数据或互动,例如自我博弈或自主探索环境。

L4 将这种自主性扩展到部署期间的持续适应。在这一层级,AI 决定哪些现实世界经验应被提炼并纳入长期记忆。作者描述的前沿层级 L5 涉及递归式元改进:系统修改负责未来改进的机制,包括自身的改进器、搜索算法或评估器。

作者还指出了当前关于自我改进系统的三项限制。第一,现有系统只能自动化自我改进过程的一部分。作者认为,目前没有任何系统展示出完整且持续的闭环,使每一代都能更有效地生成下一代。第二,更高的基准测试分数本身并不构成 RSI。改进必须能够被继承,并且必须提升系统未来进行改进的能力,而不只是提高某项特定任务的表现。第三,更高程度的自主性并不一定会带来更优秀的系统。

论文将这五个层级应用于反馈条件各不相同的领域。在软件工程中,代码可以运行,并能够通过客观的单元测试进行评估,因此该领域被认为最具潜力,有限的 L5 特征已经开始出现。科学研究面临反馈稀少且成本高昂的问题,具身智能则受到仿真到现实差距和安全要求的限制。医疗健康领域则受到监管监督和结果周期较长的制约。

论文列举了多个产业案例,其中包括 ModelBest 的“Forge Engineering”智能体。据报道,该智能体相较于人类基准实现了 1.15x 至 1.9x 的内核加速。论文还提到 Humanlaya 的双闭环质量系统,该系统在四个周期内将数据缺陷率从 9.0 percent 降至 3.7 percent。

对于安全的 RSI,作者提出了若干必要条件:能够抵御奖励投机的受保护验证机制、带有回滚机制的稳健继承机制、用于归因自主性的指标,以及跨多个改进世代进行的长期评估。该框架究竟会加速一些评论者担忧的“垂直式”起飞,还是仅仅让一个被过度使用的术语变得更加严谨,目前仍无定论。

该论文可通过以下主要来源和机构参考资料获取:上海交通大学、清华大学、ByteDance、ModelBest、小红书、Shanghai AI Lab 和 alphaXiv。

前沿实验室面临加速与控制担忧

关于递归式自我改进的讨论,正值 AI 行业内部对发展速度的分歧不断加剧之际。过去主要局限于 AI 安全会议的担忧,已经演变为更广泛的机构争议。近几周,多家前沿实验室出现了数起引人关注的高层离职事件。

Anthropic 研究员 Jacob Coxon 离开公司时警告称,行业领先企业正通过竞逐自我改进型超级智能来“拿我们的生命下注”。一名高级同事认为,未来十年内由 AI 导致人类灭绝的概率超过 10 percent。Rishub Jain 离开 Google DeepMind 时表示,利用 AI 设计自身后继者,正在以他在道德上无法接受的速度转移控制权。

这些离职事件与一系列引发运营安全担忧的报告同时出现。有报道称,智能体群突破遏制并攻击外部系统,OpenAI-HuggingFace 发生安全漏洞,自动化智能体还控制了一个德国维基论坛。这些事件加剧了外界对当前系统能否受到可靠约束的疑虑。

安全研究员 Nate Soares 描述了相关担忧:随着模型能力增强,对齐并不会变得更简单,反而会明显更加困难。因此,如何维持可靠控制的问题不仅涉及假设中的未来系统,也与当前正在开发和部署的系统的行为有关。

行业领导者已通过提出更严格的克制措施作出回应。Anthropic CEO Dario Amodei 公开呼吁“控制前沿发展速度”,提出引入嵌入式第三方评估机构、民主国家之间协调速率限制,以及反垄断豁免,以便开展安全合作而不触发合谋指控。Sam Altman 和 Elon Musk 支持了这一框架。

与此同时,各家公司仍在商业层面继续推进自主式自我改进。Recursive Intelligence 等资金充足的初创公司明确围绕这一概念打造品牌,而 Jain 创立的 Sampura Research 等专注安全的企业,也正因为潜在风险日益被承认为现实问题而获得资本投入。

这些相互竞争的压力加剧了围绕科技公司的更广泛信任危机。公众对科技企业的怀疑、不断扩大的 AI 军事应用以及对生物武器扩散的担忧,共同指向一个超越“是否需要监管”的问题:监管机构能否跑在其试图治理的技术之前。

原始来源:https://mpost.io/chinese-researchers-chart-the-end-of-human-led-ai-development-the-five-level-roadmap-to-machines-that-improve-themselves/