新闻股票GPT-6 Astra 用户称 OpenAI 新模型遭到“削弱”

GPT-6 Astra 用户称 OpenAI 新模型遭到“削弱”

作者: Decrypt·

要点速览

  • 一些用户报告 GPT-6 Astra 现在响应更快但输出质量更低,开发者 Pankaj Kumar 怀疑 OpenAI 削减了模型的计算投入,该公司尚未证实这一更改。
  • Salio 和研究员 Md Ismail Sojal 表示,他们在发布日和当前版本上使用相同设置运行了相同提示词,两人都报告当前模型的结果更差。
  • Dax Raad 领导的 Opencode 团队在支出翻倍后转回 GPT-5.6 Sol,认为 Astra 的缺点不值得其高昂定价。
  • 包括 Antikythera 和 T3Chat 创始人 Theo 在内的批评者认为,模型并未改变,是发布周热度的消退暴露了其长期存在的不稳定性。
  • Astra 仍是 OpenAI 首个跨越公司网络安全风险关键阈值的模型,定价为每百万输入 token 10 美元、每百万输出 token 50 美元,是 Sol 发布时定价的 2.5 倍。
GPT-6 Astra 用户称 OpenAI 新模型遭到“削弱”

用户在 X 上大量投诉,称 OpenAI 的 GPT-6 Astra 在发布仅一周后能力下降。一些用户报告响应更快但结果更差,另一些人则认为该模型一直就不稳定,只是最初的热度掩盖了其弱点。

一周前,GPT-6 Astra 还在游戏引擎中逐条街道地重建曼哈顿,其能力令用户赞叹不已。而本周,部分同样的用户正在发布截图,询问 OpenAI 这个模型到底出了什么问题。

Astra 今天的表现在我看来明显变笨了,”化名开发者 synthwavedd 在 X 上写道。“出现‘发布后脑叶切除术’只是时间问题。可惜。”

这种模式对人工智能聊天机器人和智能体的用户来说并不陌生,他们有时会感觉心仪的模型在发布后被“削弱”(nerf)了——这个源自游戏行业的术语,指开发者削弱了原本过于强大的东西。感知到的性能下降可能有合理的解释,但针对 GPT-6 Astra 的类似投诉数量之多,促使用户对比输出结果、检查模型是否发生了变化。这个问题对依赖租用而非自建模型的开发者来说具有实际意义,而由于专有系统不开放内部细节,并排对比输出结果是外界为数不多的验证手段之一。

此前曾称赞过 Astra 的开发者 Pranjal Paliwal 表示,他后来审查了该模型编写的代码,并改变了自己的评价。

我们没有 AGI,”Paliwal 写道。“我们遇到的是一次性能倒退。”

AGI 即通用人工智能,是业界对能够执行人类可执行的几乎任何认知任务的机器的称呼。OpenAI 总裁在 Astra 发布时使用了这个词。一周后,Paliwal 借用这个词来描述模型表面能力与其错误之间的落差。

其他投诉呈现出类似的模式。开发者 Pankaj Kumar 列举了响应更快、质量更低的症状,并怀疑 OpenAI“降低了 juice value”。创始人 Saba 也直接质问 OpenAI,为什么她现在必须“把任务简化”才能完成工作。

“Juice value”并非官方技术术语。在本文语境中,用户用它来指代模型在回答前投入的计算量,以及对 OpenAI 可能在发布演示结束后削减了这部分投入的怀疑。OpenAI 尚未证实对 Astra 做出了此类更改。

一些用户尝试了直接对比。Salio 和研究员 Md Ismail Sojal 表示,他们使用相同设置,在发布日和当前版本上分别运行了相同的提示词。两人都报告当前模型的结果更差。

今天的 GPT-6 Astra 出看起来更差。GPT-6 Astra 发布时对比 GPT-6 Astra 今天,”Sojal 写道。该帖称对比使用了相同的提示词和设置,并且“[差异比我预期的更大]”。

其他用户表示已转回 Astra 的前代模型。构建编程工具 Opencode 的 Dax Raad 表示,他的团队已回到 GPT-5.6 Sol,因为支出翻倍而使用 Astra 的缺点不值得这个成本。ChatGPT 用户 Mustafa Sahinli 的说法更直白:Astra 现在让他想起了“发布 1 周后”的 Claude Opus 4.6,暗指 Anthropic 的模型在发布后同样遭遇的反弹。

不过,并非所有人都认为 OpenAI 故意削弱了 Astra。化名用户 Antikythera 发表了这批投诉中最详细的反驳,认为时间线可能恰恰相反。

它和发布时一样笨,”Antikythera 写道。“模型不错,但问题很多。它很懒惰。写得像个要点成瘾者……发布周大家被过度炒作,现在他们有时间测试并看到它的错误了。”

按照这种解释,Astra 并没有变差;只是用户不再被早期的演示所迷惑,开始注意到它一直存在的老问题。

T3Chat 创始人 Theo 的观点大致相似。他表示,Astra 实际上比 Claude Fable 更不稳定,有时能产出出色的代码,有时则会写出极其糟糕的代码。

GPT-6 Astra 做出过不可思议的事情,我从没想过模型能做到。它也做出过一些我见过的模型最愚蠢的行为。总的来说,Fable 5.1 只是照我要求的去做,”Theo 于 2026 年 9 月 8 日在 X 上写道。他提出,负面案例的增多可能反映的是模型最初蜜月期的结束,而非其行为已确认发生变化。

这场争议与 OpenAI 上一款旗舰模型 GPT-5.6 Sol 的经历如出一辙。7 月,用户称 Sol 的最高推理模式突然变得不再深入。OpenAI 高管 Tibo Sottiaux 否认故意削弱该模型,但证实公司一直在试验“推理力度”(reasoning effort)这一设置,它控制模型在给出答案前进行多少步的“思考”。

一条回复概括了关于封闭式 AI 实验室的常见笑话:公司发布一个模型,几天后它就“染上某种怪病,突然变笨了”。另一位用户则以一句话给出了更愤世嫉俗的解释:“它们很可能被量化了,这样就不会烧掉公司那么多钱。”

量化是指降低模型内部计算的精度以削减成本,往往以牺牲一定的准确性为代价。OpenAI 从未证实曾故意对已发布的模型进行量化。

OpenAI 尚未就 Astra 发表类似 Sol 时期的声明。7 月,针对 Sol 的类似投诉浪潮曾得到公司高管的公开回应;OpenAI 是否会以同样方式回应 Astra 的投诉仍是未知数。该模型仍是公司首个跨越 OpenAI 所称的网络安全风险关键阈值的模型。这一评级意味着 Astra 能够在无人引导的情况下发现并将此前未知的软件漏洞串联利用,该能力通过 OpenAI 的 Daybreak 计划仅限于经审核的防御者使用。

无论 Astra 是否变差,其标价仍为每百万输入 token 美元、每百万输出 token 50 美元——是 Sol 发布时定价的 2.5 倍,而至少已有一个团队认定这份溢价不值得支付。