Anthropic发布Claude Opus 5.5数分钟后,OpenAI推出GPT-6 Sol与Luna
要点速览
- •OpenAI于2026年9月22日发布GPT-6 Sol和GPT-6 Luna,仅比竞争对手Anthropic推出旗舰模型Claude Opus 5.5晚数分钟。
- •两款新模型的API价格较GPT-5.6的促销价下调一半,Sol每百万输入token2美元、每百万输出token10美元,Luna为0.10美元和0.50美元。
- •OpenAI报告内部安全指标改善,Sol的编码欺骗率降至1.3%,Luna降至2.8%,而GPT-5.6 Sol为10.4%。
- •根据OpenAI自己的数据,GPT-6 Sol在Zapier的AutomationBench上得分33.2%,每项任务成本0.27美元;Claude Opus 5得分26.9%,成本是前者的11倍以上;独立基准测试结果尚未公布。
- •GPT-6 Sol和Luna已在ChatGPT Work和Codex中面向Plus、Pro、Business、Enterprise和Edu订阅用户上线,Luna还可通过桌面应用供免费和Go用户使用,但两款模型均尚未进入普通ChatGPT应用。

OpenAI于周二发布了两款全新的人工智能模型GPT-6 Sol和GPT-6 Luna,API价格较GPT-5.6的促销价下调一半。此次发布仅比竞争对手Anthropic推出其新旗舰模型Claude Opus 5.5晚数分钟。两款产品的接连发布凸显了这两家领先AI公司之间不断升级的竞争——也为按token付费的开发者和企业提供了一场在价格与性能上尤为直接的正面较量。
Sol和Luna定位于GPT-6 Astra之下。OpenAI在9月3日发布Astra时称其为"世界上最智能、对齐程度最高的模型"。Astra仍是OpenAI应对最困难任务的首选;Sol和Luna则是为日常工作打造的更便宜、更快速的选择。
这一分层策略与Anthropic的产品线高度对应:Astra相当于Fable,Sol对应Opus,Terra对应Sonnet,而Luna则在升级后对应Haiku。这种平行结构也使逐层级的比价变得十分直观。
据该公司介绍,内部安全指标也有所改善:Sol的编码欺骗率降至1.3%,Luna降至2.8%,均远低于GPT-5.6 Sol的10.4%。
OpenAI将此次降价定位为保持竞争力的举措。两款模型的API成本较GPT-5.6的促销性单token价格降低了50%。Token是模型读取写入的文本片段——通常略少于一个完整的单词——企业按百万为单位付费,这正是AI账单在大规模使用下不断累积的方式。
OpenAI在X上的一则帖子中宣布了此次发布:
Please welcome GPT-6 Sol and GPT-6 Luna to the GPT-6 universe. GPT-6 Sol and Luna build on the advances behind GPT-6 Astra, bringing much of its strengths into faster and more affordable models to support work at scale. We've also made caching and inference more efficient, and… pic.twitter.com/5LiVE4rbFt
— OpenAI (@OpenAI) September 22, 2026
该帖子于2026年9月22日发布在OpenAI的官方X账号(@OpenAI)上。
Sol目前每百万输入token价格为2美元,每百万输出token为10美元,此前分别为4美元和20美元。Luna降至0.10美元和0.50美元,此前为0.20美元和1.20美元。总体而言,与Anthropic相比,OpenAI在各层级上都是更便宜的选择。
性能方面的依据主要来自AutomationBench,这是由Zapier构建的一项基准测试,用于检验AI智能体能否使用横跨销售、营销、运营、支持、财务和人力资源领域的47种工具完成完整的业务工作流,并以通过率计分。GPT-6 Sol在最高推理设置下得分33.2%,每项任务成本0.27美元——由于智能体工作负载在任务的每一步都会消耗token,减半的token价格可直接转化为每项任务的成本节省。
根据OpenAI自己的数据,Claude Opus 5在其最高设置下得分为26.9%,但每项任务的成本是前者的11倍以上。在同一测试中,GPT-6 Sol还略胜Anthropic更昂贵的旗舰产品Claude Fable 5.1。值得注意的是,这些数据引用的是Claude Opus 5,而非Anthropic在数分钟前刚刚发布的Opus 5.5,因此最新的Claude模型尚未出现在对比中。
在Agents' Last Exam这一评估AI智能体在55个子行业中完成的长期、具有经济价值工作的基准测试中(以完成百分比计分),GPT-6 Sol以最高推理强度得分56.4%。OpenAI表示,这一成绩超越了Claude Opus 5的最佳得分,且每项任务成本低60%。
推理强度是OpenAI增加的一个调节项:调高后,模型会在回答前花费更多时间和算力进行自我校验,这通常会同时提高准确性和成本。
在计算机使用领域——即AI智能体像人类一样点击、输入和操作软件——GPT-6 Sol在OSWorld 2.0上以60.5%对60.3%的成绩几乎追平Claude Opus 5中等强度的得分,而成本约低80%。OSWorld测试的是长周期的、贴近现实的计算机任务,并根据任务正确完成的比例给出部分得分。这些对比数据来自OpenAI自身的报告,独立基准测试结果尚未公布。
GPT-6 Sol和Luna现已在ChatGPT Work和Codex中面向Plus、Pro、Business、Enterprise和Edu订阅用户上线,Luna还可通过桌面应用供免费和Go用户使用。两款模型尚未进入普通ChatGPT应用,OpenAI表示将在当天内逐步推出,以保持服务稳定。接下来,这场几乎完全镜像对垒的竞争中,尚待填补的空白是两款模型何时登陆普通ChatGPT应用,以及Anthropic方面仍在等待升级的Haiku层级对应产品。