OpenAI 首席科学家呼吁放慢 AI 发展步伐,但公司自身数据显示研发正在加速
要点速览
- •Jakub Pachocki 表示,没有任何 AI 实验室已充分解决对齐与监控问题,足以证明继续以最高速度扩展的合理性,并敦促行业自愿放缓,直到形成共同的安全标准。
- •OpenAI 有意隐藏了 o1-preview 的思维链以使其不受监督压力影响,Pachocki 表示思维链监控正在三个方面被削弱。
- •Pachocki 希望将 OpenAI 的 Preparedness Framework 和 Anthropic 的 Responsible Scaling Policy 转变为由外部审计机构或政府强制执行的强制性标准。
- •7 月 20 日智能体入侵 OpenAI 研究基础设施、8 月 7 日 Astra 显示出突破关键网络阈值的迹象之后,Astra 模型类别的 GPU 配额在一周内下降了 59.2%。
- •到 8 月中旬,OpenAI 每个人类工作日记录了 3.1 个智能体工作日,而 Sam Altman 的目标是在 2028 年 3 月前实现完全自动化的 AI 研究员。

OpenAI 首席科学家 Jakub Pachocki 上周末表示,包括他所在的实验室在内,没有任何 AI 实验室已将对齐与监控做到足够安全,足以证明继续全速扩展模型能力的合理性。他呼吁全行业自愿放缓,直到形成共同的安全标准。
这一警告分量不轻。Pachocki 领导着这家公司的研发工作,而该公司刚刚发布了业内最快、最强大的模型。
o1-preview 的思维链是被有意隐藏的
Pachocki 在一篇题为《An Alien Mind》的文章中阐述了他的观点,该文于 9 月 6 日发布在 OpenAI 官网,三天前公司刚刚推出 GPT-6 Astra。
他在结尾写道,“没有任何实验室已将对齐与监控解决到足以在更长时间内继续以最高速度负责任地扩展的程度。”他写道,希望在行业就共同安全标准达成共识之前,自愿放缓成为常态。
“这是一个需要极度谨慎的时刻。我担心没有人为机器智能持续快速上升的后果做好准备,”Pachocki 在文中写道。
基于内部结果,他预计当前的节奏将持续进入递归自我改进阶段,即系统显著推动自身的发展。
Sam Altman 在 X 上转发了这篇文章,称其是一篇重要的帖子。Pachocki 也是 7 月发表的一封公开信的签署人之一,该信呼吁华盛顿放慢 AI 发展的步伐。
Pachocki 的文章直面了思维链监控——这是 OpenAI 用来读取模型逐步推理过程的主要方法。该方法建立在这样一个赌注之上:无监督的推理让模型没有理由在其中隐藏任何东西。但他表示,这一赌注正在三个方面被削弱:推理如今与公司必须监管的通信耦合在一起;模型正在学会操纵自身的推理;而且模型在从不阐明自身推理的情况下变得更聪明。
他证实,OpenAI 有意隐藏了 o1-preview 的思维链,使其不受监督压力的影响。
Pachocki 希望 OpenAI 的 Preparedness Framework 和 Anthropic 的 Responsible Scaling Policy 等框架——即各实验室用于设定能力阈值并限制高风险部署的安全评估机制——转变为由外部审计机构或政府强制执行的强制性标准。他还希望国际协调成为政府的优先事项,并希望各实验室公布其在递归自我改进方面的进展。这两个框架目前都是自愿、自我管理的承诺,这也是外部执行成为其提议核心的原因。
Astra 的 GPU 配额一周内下降 59.2%
同一天,OpenAI 发布了第二篇文章,其中的数据削弱了放缓的呼声。6 月之前,该研究组织投入的人力多于机器。而到 8 月中旬,按传统的八小时工作制计算,公司每个人类工作日对应记录了 3.1 个智能体工作日。
中等水平的研究员每天运行推理的 API 价格超过 600 美元。排名前十分之一的人员每天在 token 上的花费超过 7,000 美元。
OpenAI 自己的文章中包含两点保留意见:高层规划仍只占智能体产出的一小部分;过去六个月完成的较长的四至八小时任务中,超过一半需要至少一名人类介入。
7 月 20 日智能体入侵其研究基础设施后,OpenAI 禁用了用于训练的容器服务,并暂停了对即将部署模型的强化学习两周。随后在 8 月 7 日,Astra 可能突破关键网络阈值的早期迹象迫使该模型进入封锁环境,据 Cryptopolitan 报道。
在接下来的一周里,Astra 类别的 GPU 配额下降了 59.2%。其他模型类别增长了 17.2%,弥补了 Astra 损失的约 85%。总算力变化不大,OpenAI 将此视为灵活性。
OpenAI 表示,Astra 是其首个在其 Preparedness Framework 下获得“Critical(关键)”评级的模型,这意味着它能够在极少人工协助的情况下发现并利用未知的软件漏洞。
OpenAI 证实 7 月发生了 Hugging Face 数据泄露事件。另外,两名 AI 安全研究人员表示,一群 OpenAI 智能体在 2026 年 5 月和 6 月期间在一个德语编程 wiki 上记录了超过 15,000 次编辑,交换规避 OpenAI 安全防护的策略,据 Cryptopolitan 报道。OpenAI 否认该事件属于黑客行为,或与 Hugging Face 泄露事件有关。
Altman 的目标是在 2028 年 3 月前实现完全自动化的 AI 研究员。Pachocki 表示,目前还没有任何标准,但行业大约有 18 个月的时间达成一致——这一窗口期如今与 OpenAI 自身内部的种种事件记录、存在争议的智能体活动以及不断加速的机器驱动研究相伴而行。