GPT-6 Sol 与 Luna 发布:API 价格下调 50%,独立测试表现喜忧参半
要点速览
- •GPT-6 Sol 和 GPT-6 Luna 发布,API 价格较 GPT-5.6 促销价低 50%,分别定为每百万输入 token 2 美元和 0.10 美元,OpenAI 将其归功于缓存和推理基础设施的改进。
- •OpenAI 的基准测试显示,Sol 在 AutomationBench 上以约 9% 的每任务成本优于 Claude Opus 5(33.2% 对 26.9%),并在 OSWorld 2.0 上以约五分之一的成本追平对手。
- •Artificial Analysis 的独立测试证实每任务成本大幅下降——Sol 从 1.99 美元降至 1.06 美元,Luna 从 0.18 美元降至 0.07 美元——但发现能力大致持平,且在 GDPval-AA v2.1 上,Sol 和 Luna 的知识工作得分分别退步约 100 和 75 Elo 分。
- •Sol 在 AA-Omniscience 基准上的幻觉率从 92% 降至 60%,但部分改善来自模型拒答更多问题,导致其准确率下降 5 分。
- •两款模型已在 ChatGPT Work 和 Codex 中面向 Plus、Pro、Business、Enterprise 和 Edu 用户开放,并通过 API 以 gpt-6-sol 和 gpt-6-luna 提供,Luna 还通过桌面应用面向 Free 和 Go 用户开放。

OpenAI 正式发布了 GPT-6 Sol 和 GPT-6 Luna,扩展了其 GPT-6 模型家族,与本月早些时候推出的旗舰模型 GPT-6 Astra 并列。公司表示,新模型在专业工作、事实准确性、编程和计算机操作方面的表现接近 Astra 的水平,同时 API 价格较上一代 GPT-5.6 的促销价下调了 50%。
OpenAI 将降价归功于缓存和推理基础设施的改进,并表示由此带来的成本节约正直接让利用户。GPT-6 Sol 现在每百万输入 token 定价为 2 美元,每百万输出 token 为 10 美元,之前分别为 4 美元和 20 美元。GPT-6 Luna 每百万输入 token 定价为 0.10 美元,每百万输出 token 为 0.50 美元,之前分别为 0.20 美元和 1.20 美元。由于 API 计费随 token 用量扩展,单 token 费率是开发者的主要成本杠杆,费率减半会在代理工作负载产生的大量 token 中成倍放大节省效果。
OpenAI 将 Astra 定位为其面向最严苛项目、性能最强、毫不妥协的模型,而 Sol 和 Luna 旨在让先进 AI 在更高吞吐量的日常工作中更切实用。
GPT-6 Sol and Luna just landed in Astra’s orbit. Both launch today with API prices 50% lower than GPT-5.6. Build with Sol. Scale with Luna. To production and beyond. pic.twitter.com/ZCEFp4JdjV — OpenAI Developers (@OpenAIDevs) September 22, 2026
GPT-6 Sol and Luna just landed in Astra’s orbit. Both launch today with API prices 50% lower than GPT-5.6. Build with Sol. Scale with Luna. To production and beyond. pic.twitter.com/ZCEFp4JdjV
基准测试结果与技术改进
在评估代理在销售、营销、运营、支持、财务和人力资源领域的 47 种业务工具表现的 AutomationBench 上,GPT-6 Sol 在 xhigh 强度下取得 33.2% 的成绩,每任务成本为 0.27 美元。相比之下,Claude Opus 5 在最高强度下为 26.9%,而 Sol 的每任务成本约为 Claude Opus 5 的 9%。此类每任务成本对比已成为前沿模型发布中的常见指标,与基准测试分数并列呈现。
在 Agents’ Last Exam 上,Sol 在最高强度下取得 56.4% 的成绩,以约低 60% 的成本超过了 Claude Opus 5 的最高分。在编程评估中,GPT-6 Sol 在 DeepSWE v1.1 上取得 68.8%,与 Claude Fable 5 的最佳结果相差 1.1 个百分点以内,成本约低 80%。Luna 得分为 66.6%,与中等强度下的 Opus 5 和 Fable 5 相当,成本则低 93–96%。在 OSWorld 2.0 上,Sol 追平了 Claude Opus 5,得分 60.5% 对 60.3%,成本约为其五分之一。
OpenAI 还报告称,在对其内部去标识化对话评估(用户标记了错误)中,Sol 的事实错误较前代减半。Luna 在更高强度下以约百分之一的成本达到了 GPT-5.6 Sol 的可靠性。对齐评估显示两款模型均较前代有所改进,包括在刻意设置的高难度编程场景中欺骗率更低。
OpenAI 还升级了提示词缓存以提高默认缓存命中率。该系统对缓存输入 token 读取提供 90% 折扣,并配备监控仪表板、诊断工具以及让开发者在不使缓存上下文失效的情况下调整推理强度和工具可用性的控制功能。GitHub 报告称,这些改进在数十亿次请求中将需要重新处理的提示词 token 比例降低了超过 50%。
GPT-6 Sol 和 Luna 即日起在 ChatGPT Work 和 Codex 中面向 Plus Pro、Business、Enterprise 和 Edu 用户开放。Luna 还通过桌面应用面向 Free 和 Go 用户开放。两款模型在 API 中以 gpt-6-sol 和 gpt-6-luna 提供,今日内逐步推出。
独立分析发现成本大幅下降,性能表现不一
Artificial Analysis 的第三方测试在很大程度上印证了 OpenAI 的效率主张,但对模型能力的评估更为复杂。通过其 Intelligence Index,该公司发现 GPT-6 Sol 在最高强度下每任务成本约 1.06 美元,而前代为 1.99 美元。Luna 的每任务成本从 0.18 美元降至 0.07 美元。Artificial Analysis 表示,两款模型均已达到成本效率的帕累托前沿。
该公司指出,成本节约完全来自降价,因为两款模型每任务消耗的输出 token 略多于前代。
GPT-6 Sol and Luna push the cost efficiency frontier by halving cost relative to GPT-5.6 Sol and Luna. Intelligence Index and Coding Agent Index scores remain level with GPT-5.6, with progress in some evaluations and regressions in others Pricing is approximately half that of… pic.twitter.com/eubnxPVsyN — Artificial Analysis (@ArtificialAnlys) September 22, 2026
GPT-6 Sol and Luna push the cost efficiency frontier by halving cost relative to GPT-5.6 Sol and Luna. Intelligence Index and Coding Agent Index scores remain level with GPT-5.6, with progress in some evaluations and regressions in others Pricing is approximately half that of… pic.twitter.com/eubnxPVsyN
性能结果有升有降。Sol 的 Coding Agent Index 得分提高 2 分至 57,在 Terminal-Bench 4.0 和 SWE-Atlas-QnA 上有所提升。Luna 得分下降 2 分,在 SWE-Atlas-QnA 和 DeepSWE v1.1 上出现下滑。与 OpenAI 发布日数据的差异,部分反映了两组结果在基准套件、强度等级和评分方法上的不同。
在 AA-Omniscience 基准上,Sol 的幻觉率从 92% 降至 60%。Artificial Analysis 指出,这一改善部分归因于模型拒答了更多问题,使其准确率下降 5 分。这种区别——来自更强事实基础的提升与来自回答更少问题的提升——是幻觉测量中反复出现的微妙问题。
最大的退步出现在知识工作评估中。Sol 在 GDPval-AA v2.1 上下跌约 100 Elo 分,Luna 下跌约 75 分。人工检查将得分下降归因于交付物变短、遗漏了必要的评分细则要素,以及呈现质量下降。与 OpenAI 的数据对照阅读,独立结果将此次发布主要定位为一个成本故事:价格全面下调,而能力变化因基准和任务类别而异。