新闻股票随着人工智能公司逼近“递归自我改进”,一位物理学教授称完全自主是“人类历史上最糟糕的主意”

随着人工智能公司逼近“递归自我改进”,一位物理学教授称完全自主是“人类历史上最糟糕的主意”

作者: Fortune Crypto·

要点速览

  • •Anthropic 表示,其 Claude 模型目前主导该公司 26% 的模型研发工作,可在人类监督下从高层级提示端到端处理大多数任务。
  • •领先的人工智能实验室对递归自我改进的定义各不相同,从人工智能对模型改进的任何反馈到完全自主的自我改进均有涵盖,因此各公司发布的进展声明无法直接比较。
  • •OpenAI 已打造出自动化的“研究实习生”,并设定了在 2028 年 3 月前创建自动化人工智能研究员的目标,同时承认其尚不知道如何安全地实现完全对齐的 RSI。
  • •埃隆·马斯克表示,xAI 的历代 Grok 模型在构建过程中人类参与越来越少,这一里程碑可能在今年年底前实现,但不会晚于 2027 年。
  • •微软人工智能业务 CEO Mustafa Suleyman 一直推广保持在既定限制之内的“人文主义超级智能”,而行业内部围绕出于安全考虑协调放缓人工智能的呼吁仍存在分歧。
随着人工智能公司逼近“递归自我改进”,一位物理学教授称完全自主是“人类历史上最糟糕的主意”

人工智能模型自学以变得更高效、更强大——这曾是技术研究人员遥远的愿景——如今正越来越接近现实。

随着这项技术不断进步,开发者表示它正在逼近“递归自我改进”(recursive self-improvement,简称 RSI),即人工智能模型找到改进自身并构建其后继版本的方法的阶段。科技公司高管表示,这一转变可能带来科学和医学方面的进步,但也伴随着风险。

其最终走向的不确定性,正是人们对人工智能脱离人类控制、乃至对人类构成潜在威胁的担忧日益加剧的核心。这些担忧促使多位人工智能行业人物在上周末共同呼吁放缓这项技术的增长步伐。

Anthropic 本周详细介绍了其模型 Claude 如何帮助公司开发下一代更智能的自身版本。Claude 目前主导 Anthropic 26% 的模型研发工作,该公司表示,这意味着它可以在人类监督下“从高层级提示端到端”完成大多数给定任务。这些模型尚未完全自主运行——至少目前还没有。

RSI 的定义之争

领先的人工智能公司对递归自我改进的定义各不相同。一些公司将其定义为人工智能对模型改进提供任何形式的反馈,另一些公司则将其定义为人工智能完全自主地朝这一目标努力。这一区别很重要:由于对何为 RSI 缺乏统一的标准,不同实验室发布的进展声明所衡量的并不是同一种东西。

非营利组织“生命未来研究所”(Future of Life Institute)总裁兼首席执行官、加州大学圣克鲁兹分校物理学教授 Anthony Aguirre 表示,自主递归自我改进本质上是指人工智能能够通过设计系统的下一个版本来改进自身,然后是再下一个版本,如此循环往复。

“这里真正关键的是,随着人工智能承担更多工作,进程会越来越快,因为人工智能的运行速度远远快于人类,”他说。

专家权衡失控风险与渐进现实

康奈尔大学计算机科学助理教授 John Thickstun 表示,围绕 RSI 的恐惧主要源于对失控超级智能从这一进程中涌现的可能性——即自我改进的系统的发展超出人类监控或控制能力的情景。他研究控制人工智能模型行为的方法。但他表示,一种更务实的观点认为,某种形式的递归自我改进在人工智能开发中已经进行了一段时间。

“多年来,我们已经在以辅助角色使用这些模型来创建下一版模型。所以人们用上一代模型为人工智能系统编写代码,然后由这些系统创建下一代,”他说。

包括 OpenAI 联合创始人 Andrej Karpathy 在内的知名人工智能研究人员,多年来一直在尝试让人工智能模型训练和改进新的人工智能系统。Thickstun 表示,这些努力带来了小幅改进,但没有产生重大的创造性飞跃。

不过 Aguirre 表示,如今的人工智能公司距离实现更大的改进飞跃要近得多。

“从 Anthropic 随时间推移发布的这些图表可以看出,越来越多的研究由人工智能完成,而且它正越来越接近完全自主,”他说。“而这种成功的结果,最终是——我认为——极其可怕的。我认为这样做可能是人类历史上最糟糕的主意。而是的,他们正在这么做。”

Anthropic 的公告让公众——以及其他实验室——得以一窥 RSI 的进展,并鼓励竞争对手分享类似的指标。竞争对手若发布相应数据,可能为行业提供一个比较自主研究进展的共同基准。尽管如此,Anthropic 尚未明确说明它距离实现完全自主的模型改进还有多远。

OpenAI 的“研究实习生”与 2028 年目标

ChatGPT 开发商 OpenAI 本月宣布,它已开发出一个自动化的“研究实习生”,其定义为一个能够在人类指导下执行明确定义的研究任务的系统,包括“一名熟练研究人员需要几天时间才能完成的任务”。该公司表示,它正朝着在 2028 年 3 月前创建自动化人工智能“研究员”的目标推进。这一日期为观察人士提供了一个具体的、由公司设定的里程碑,用以衡量相关进展。

在公告中,OpenAI 表示,虽然 RSI 可以帮助使模型的行为与人类的价值观和意图保持一致,但这并不意味着“快速 RSI 是我们应当追求的必然结果”。

“是否以及如何推进,必须取决于我们保持人类控制的能力,以及就收益和风险作出的知情民主选择,”该公司在博客文章中表示。

马斯克暗示 xAI 更快的时间表

埃隆·马斯克似乎更急于推进。他在今年 3 月谈到 xAI 的 Grok 模型时表示,“人类在模型改进中的参与正逐渐越来越少”,并且“每一个后续模型都是由前一个模型构建的”,但他澄清说这一流程尚未完全自动化。他补充说,这一目标可能在今年年底前实现,“但不会晚于”2027 年——这一时间表领先于 OpenAI 的 2028 年 3 月目标,尽管两家公司对这一里程碑的描述有所不同。

微软的“人文主义”替代方案

微软和其他一些领先的人工智能公司似乎正在采取不同的路径。微软人工智能业务 CEO Mustafa Suleyman 表示,公司正在迈向“人文主义超级智能”——即为人类和全人类整体服务的先进人工智能能力。Suleyman 在 2025 年的一篇文章中表示,这并不意味着“一个拥有高度自主性的无边界、无限制的实体”,而是“经过精心校准、情境化、处于限制之内”的人工智能。

安全措施难以跟上步伐

实验室面临的一个关键挑战——实际上自这项技术诞生以来就一直存在——是确保其安全措施与模型能力同步发展。

出于安全考虑对协调放缓人工智能的呼吁在科技行业引发了分歧,人工智能领域的每个主要参与者并非都具体阐述了其在 RSI 方面的前进路径。

Anthropic 一直是呼吁控制节奏的主要声音,该公司表示,它会放缓或暂时暂停其开发工作——前提是其全球竞争对手也这样做,并且以“可验证的方式”进行。

OpenAI 本月明确表示,它尚不知道如何“安全地一路实现完全对齐的、完整的 RSI”,并补充说,公司“不能假设对齐和安全方面的进展会与之保持同步”。它继续表示,能力更强的系统可能变得更难监控,但推进 RSI 仍是该公司重视的目标,因为“自动化的人工智能研究员也可以是自动化的安全或对齐研究员”。

本文最初发表于 Fortune.com。