GPT-6 Sol 與 Luna 上市,API 價格調降 50%,獨立測試顯示表現好壞參半
重點速覽
- •GPT-6 Sol 與 GPT-6 Luna 上市,API 價格較 GPT-5.6 促銷價低 50%,分別定為每百萬輸入 tokens 2 美元與 0.10 美元,OpenAI 將此歸因於快取與推論基礎架構的改進。
- •OpenAI 的基準測試顯示,Sol 在 AutomationBench 上以約 9% 的每任務成本超越 Claude Opus 5(33.2% 對 26.9%),並在 OSWorld 2.0 上以約五分之一的成本與其持平。
- •Artificial Analysis 的獨立測試證實每任務成本大幅下降——Sol 從 1.99 美元降至 1.06 美元,Luna 從 0.18 美元降至 0.07 美元——但發現能力分數大致持平,且在 GDPval-AA v2.1 上,Sol 與 Luna 在知識型工作方面分別出現約 100 與 75 個 Elo 分的退步。
- •Sol 在 AA-Omniscience 基準上的幻覺率從 92% 降至 60%,但部分改善來自模型拒答更多問題,使其準確度下降 5 個百分點。
- •兩款模型已在 ChatGPT Work 與 Codex 中向 Plus、Pro、Business、Enterprise 與 Edu 使用者開放,並透過 API 以 gpt-6-sol 與 gpt-6-luna 提供,Luna 另可透過桌面應用程式供 Free 與 Go 使用者使用。

OpenAI 已正式發布 GPT-6 Sol 與 GPT-6 Luna 兩款新模型,與本月初推出的旗艦模型 GPT-6 Astra 一同擴展 GPT-6 模型家族。該公司表示,新模型在專業工作、事實性、程式編寫與電腦操作方面提供接近 Astra 水準的表現,同時將 API 價格較前一世代 GPT-5.6 的促銷價調降 50%。
OpenAI 將價格下調歸因於快取與推論基礎架構的改進,並表示相關節省直接回饋給使用者。GPT-6 Sol 現在每百萬輸入 tokens 收費 2 美元、每百萬輸出 tokens 收費 10 美元,低於先前的 4 美元與 20 美元。GPT-6 Luna 每百萬輸入 tokens 為 0.10 美元、每百萬輸出 tokens 為 0.50 美元,先前價格分別為 0.20 美元與 1.20 美元。由於 API 計費隨 token 用量而增加,單位 token 費率是開發者的主要成本槓桿,費率減半會在代理工作負載產生的大量 token 中產生複利效果。
OpenAI 將 Astra 定位為應對最嚴苛專案的最高能力模型,而 Sol 與 Luna 則旨在讓進階 AI 更適用於高用量的日常工作負載。
GPT-6 Sol and Luna just landed in Astra’s orbit. Both launch today with API prices 50% lower than GPT-5.6. Build with Sol. Scale with Luna. To production and beyond. pic.twitter.com/ZCEFp4JdjV — OpenAI Developers (@OpenAIDevs) September 22, 2026
GPT-6 Sol and Luna just landed in Astra’s orbit. Both launch today with API prices 50% lower than GPT-5.6. Build with Sol. Scale with Luna. To production and beyond. pic.twitter.com/ZCEFp4JdjV
基準測試結果與技術改進
在測試代理於銷售、行銷、營運、支援、財務與人力資源等 47 種業務工具表現的 AutomationBench 上,GPT-6 Sol 在 xhigh 努力程度下以每項任務 0.27 美元的成本取得 33.2% 的分數。相比之下,Claude Opus 5 在最大努力程度下為 26.9%,而 Sol 的每項任務成本約為 Claude Opus 5 9%。此類每任務成本比較已成為前沿模型發布的標準項目,與重點基準分數並列。
在 Agents’ Last Exam 上,Sol 在最大努力程度下達到 56.4% 的分數,以約低 60% 的成本超越 Claude Opus 5 的最高分。在程式編寫評測中,GPT-6 Sol 在 DeepSWE v1.1 上得分 68.8%,與 Claude Fable 5 的最佳結果相差 1.1 個百分點以內,成本約低 80%。Luna 得分 66.6%,與 Opus 5 和 Fable 5 在中等努力程度下的表現相當,成本則低 93–96%。在 OSWorld 2.0 上,Sol 以 60.5% 對 60.3% 追平 Claude Opus 5,成本約為其五分之一。
OpenAI 也表示,在針對使用者標記錯誤的去識別化對話的內部評估中,Sol 的事實錯誤率較其前代模型減半。在較高努力程度下,Luna 以約百分之一的成本達到 GPT-5.6 Sol 的可靠度。對齊評估顯示兩款模型的表現均優於前代,包括在刻意設計的挑戰性程式編寫情境中欺騙率較低。
OpenAI 亦升級了提示快取以提高預設快取命中率。該系統對快取輸入 token 的讀取提供 90% 折扣,並包含監控儀表板、診斷工具,以及讓開發者在不使快取上下文失效的情況下調整推理努力程度與工具可用性的控制項。GitHub 表示,這些變更在數十億次請求中,將需要重新處理的提示 token 比例減少了超過 50%。
GPT-6 Sol 與 Luna 即日起在 ChatGPT Work 與 Codex 中向 Plus、Pro、Business、Enterprise 與 Edu 使用者開放。Luna 也可透過桌面應用程式供 Free 與 Go 使用者使用。兩款模型皆透過 API 以 gpt-6-sol 與 gpt-6-luna 提供,並於當日逐步推出。
獨立分析發現成本大幅下降,但表現好壞參半
Artificial Analysis 的第三方測試大致支持 OpenAI 的效率主張,但對模型能力的評估較為好壞不一。該機構運用其 Intelligence Index 發現,GPT-6 Sol 在最大努力程度下每項任務成本約為 1.06 美元,而其前代為 1.99 美元。Luna 的成本從每項任務 0.18 美元降至 0.07 美元。Artificial Analysis 表示,兩款模型均已達到成本效率的 Pareto 前沿。
該機構指出,節省完全來自價格下調,因為兩款模型每項任務所消耗的輸出 tokens 略多於其前代。
GPT-6 Sol and Luna push the cost efficiency frontier by halving cost relative to GPT-5.6 Sol and Luna. Intelligence Index and Coding Agent Index scores remain level with GPT-5.6, with progress in some evaluations and regressions in others Pricing is approximately half that of… pic.twitter.com/eubnxPVsyN — Artificial Analysis (@ArtificialAnlys) September 22, 2026
GPT-6 Sol and Luna push the cost efficiency frontier by halving cost relative to GPT-5.6 Sol and Luna. Intelligence Index and Coding Agent Index scores remain level with GPT-5.6, with progress in some evaluations and regressions in others Pricing is approximately half that of… pic.twitter.com/eubnxPVsyN
效能結果顯示既有進步也有退步。Sol 的 Coding Agent Index 分數增加 2 分至 57, Terminal-Bench 4.0 與 SWE-Atlas-QnA 上有所提升。Luna 的分數下降 2 分,在 SWE-Atlas-QnA 與 DeepSWE v1.1 上出現下滑。相較 OpenAI 發布日數據的分歧,部分反映了兩組結果在基準套件、努力程度與評分方法上的差異。
在 AA-Omniscience 基準上,Sol 的幻覺率從 92% 降至 60%。Artificial Analysis 指出,此一改善部分歸因於模型拒答更多問題,使其準確度下降 5 個百分點。這種區別——來自更強事實基礎的收益,與來自回答更少問題的收益——是幻覺測量中反覆出現的細微之處。
最大的退步出現在知識型工作評測中。Sol 在 GDPval-AA v2.1 上下降約 100 個 Elo 分,Luna 下降約 75 分。人工檢視將分數下滑歸因於交付成果較短、遺漏必要的評分準則元素,以及呈現品質下降。與 OpenAI 的數據並列來看,獨立結果將此次發布主要定位為成本議題:價格全面下調,而能力變化則因基準與任務類別而異。