ニュース株式GPT-6 SolとLuna、API価格を50%引き下げて提供開始 独立テストでは性能に明暗

GPT-6 SolとLuna、API価格を50%引き下げて提供開始 独立テストでは性能に明暗

著者: Metaverse Post·

重要ポイント

  • GPT-6 SolとGPT-6 Lunaは、GPT-5.6のプロモーション料金からAPI価格を50%引き下げて提供開始され、入力トークン100万個当たりの料金はそれぞれ$2と$0.10となった。OpenAIはキャッシュと推論インフラの改善を要因としている。
  • OpenAIのベンチマークでは、SolがAutomationBenchでClaude Opus 5を上回り(33.2%対26.9%)、1タスク当たりのコストは約9%だった。また、OSWorld 2.0では約5分の1のコストで同モデルに並んだ。
  • Artificial Analysisの独立テストは、1タスク当たりコストがSolで$1.99から$1.06、Lunaで$0.18から$0.07に低下したことを確認した一方、能力スコアはおおむね横ばいで、GDPval-AA v2.1ではSolが約100 Eloポイント、Lunaが約75ポイント低下した。
  • AA-OmniscienceベンチマークでSolのハルシネーション率は92%から60%に低下したが、その一部は回答を拒否する質問が増えたことによるもので、正確性は5ポイント低下した。
  • 両モデルはPlus Pro、Business、Enterprise、Eduユーザー向けにChatGPT WorkとCodexで利用でき、APIではgpt-6-solとgpt-6-lunaとして提供される。Lunaはデスクトップアプリを通じてFreeおよびGoユーザーも利用できる。
GPT-6 SolとLuna、API価格を50%引き下げて提供開始 独立テストでは性能に明暗

OpenAIはGPT-6 SolとGPT-6 Lunaをリリースし、今月初めに発表された旗艦モデルGPT-6 AstraとともにGPT-6モデルファミリーを拡大した。同社によると、新モデルは業務利用、事実性、コーディング、コンピューター操作でAstraに迫る性能を発揮し、従来世代GPT-5.6のプロモーション価格と比べてAPI価格を50%引き下げる。

OpenAIは価格引き下げについて、キャッシュと推論インフラの改善によるものだと説明し、その結果生じたコスト削減をユーザーに直接還元するとしている。GPT-6 Solは現在、入力トークン100万個当たり$2、出力トークン100万個当たり$10で、従来の$4と$20から引き下げられた。GPT-6 Lunaは入力トークン100万個当たり$0.10、出力トークン100万個当たり$0.50で、従来の$0.20と$1.20から低下した。APIの料金はトークン量に応じて増えるため、トークン当たりの料金は開発者にとって主要なコスト要因となる。料金が半減すれば、エージェントのワークロードで発生し得る大量のトークン利用全体にわたって削減効果が積み重なる。

OpenAIはAstraを最も難易度の高いプロジェクト向けの最高性能モデルと位置付ける一方、SolとLunaは、より大量かつ日常的なワークロードで先進的なAIを実用化することを目的としている。

GPT-6 Sol and Luna just landed in Astra’s orbit. Both launch today with API prices 50% lower than GPT-5.6. Build with Sol. Scale with Luna. To production and beyond. pic.twitter.com/ZCEFp4JdjV — OpenAI Developers (@OpenAIDevs) September 22, 2026

GPT-6 Sol and Luna just landed in Astra’s orbit. Both launch today with API prices 50% lower than GPT-5.6. Build with Sol. Scale with Luna. To production and beyond. pic.twitter.com/ZCEFp4JdjV

ベンチマーク結果と技術的改善

47種類の業務ツールを使い、営業、マーケティング、オペレーション、サポート、財務、人事の各分野でエージェントを評価するAutomationBenchで、GPT-6 Solはxhigh effortにおいて、1タスク当たり$0.27のコストで33.2%を記録した。これは、最大推論強度で26.9%だったClaude Opus 5と比較して高い数値であり、Solの1タスク当たりのコストはClaude Opus 5の約9%だった。この種のタスク当たりコストの比較は、主要ベンチマークのスコアと並び、最先端モデルの発表で標準的に示される項目となっている。

Agents’ Last Examでは、Solは最大推論強度で56.4%を達成し、Claude Opus 5の最高スコアを上回りながら、コストは約60%低かった。コーディング評価では、GPT-6 SolはDeepSWE v1.1で68.8%を記録し、Claude Fable 5の最高結果との差は1.1ポイント以内だった一方、コストは約80%低かった。Lunaは66.6%で、Opus 5および中程度の推論強度におけるFable 5と同程度の結果を、93~96%低いコストで達成した。OSWorld 2.0では、Solは60.5%対60.3%でClaude Opus 5に並び、コストは約5分の1だった。

OpenAIはまた、ユーザーが誤りを指摘した匿名化済み会話を用いた社内評価で、Solの事実誤り率が前モデルから半減したと報告した。より高い推論強度では、LunaはGPT-5.6 Solと同等の信頼性を、コスト約100分の1で実現した。アラインメント評価では、意図的に難しく設定されたコーディングシナリオにおける欺瞞の発生率低下など、両モデルが前モデルから改善したことが示された。

OpenAIはまた、デフォルトのキャッシュヒット率を高めるため、プロンプトキャッシュを強化した。このシステムでは、キャッシュ済み入力トークンの読み取りに90%の割引が適用されるほか、監視ダッシュボード、診断ツール、キャッシュ済みコンテキストを無効化せずに開発者が推論強度や利用可能なツールを調整できる制御機能が提供される。GitHubは、これらの変更により、数十億件のリクエスト全体で新たな処理を必要とするプロンプトトークンの割合が50%超減少したと報告した。

GPT-6 SolとLunaは、Plus Pro、Business、Enterprise、Eduユーザー向けにChatGPT WorkとCodexで利用可能となった。Lunaはデスクトップアプリを通じてFreeおよびGoユーザーも利用できる。両モデルはAPIではgpt-6-solgpt-6-lunaとして提供され、日中を通じて段階的に展開される。

独立分析、コスト削減と性能の混在を確認

Artificial Analysisによる第三者テストは、OpenAIの効率性に関する主張を概ね支持した一方、モデルの能力についてはより混在した評価を示した。同社のIntelligence Indexを用いた評価では、GPT-6 Solは最大推論強度で1タスク当たり約$1.06となり、前モデルの$1.99と比べて約半分だった。Lunaのコストは$0.18から$0.07に低下した。Artificial Analysisは、両モデルがコスト効率のパレートフロンティアに到達したとしている。

同社によると、コスト削減は完全に価格引き下げによるものだった。両モデルは、前モデルよりも1タスク当たりにわずかに多くの出力トークンを使用したためだ。

GPT-6 Sol and Luna push the cost efficiency frontier by halving cost relative to GPT-5.6 Sol and Luna. Intelligence Index and Coding Agent Index scores remain level with GPT-5.6, with progress in some evaluations and regressions in others Pricing is approximately half that of… pic.twitter.com/eubnxPVsyN — Artificial Analysis (@ArtificialAnlys) September 22, 2026

GPT-6 Sol and Luna push the cost efficiency frontier by halving cost relative to GPT-5.6 Sol and Luna. Intelligence Index and Coding Agent Index scores remain level with GPT-5.6, with progress in some evaluations and regressions in others Pricing is approximately half that of… pic.twitter.com/eubnxPVsyN

性能結果は、改善と低下の両方を示した。SolのCoding Agent Indexスコアは2ポイント上昇して57となり、Terminal-Bench 4.0とSWE-Atlas-QnAで改善した。Lunaのスコアは2ポイント低下し、SWE-Atlas-QnAとDeepSWE v1.1で下落した。OpenAIが発表初日に示した数値との違いは、両結果でベンチマークの構成、推論強度、採点方法が異なることを一部反映している。

AA-Omniscienceベンチマークでは、Solのハルシネーション率が92%から60%に低下した。Artificial Analysisは、この改善の一部が、モデルがより多くの質問への回答を拒否したことによるものだと指摘しており、その結果、正確性は5ポイント低下した。より強い事実性に基づく改善と、回答する質問を減らしたことによる改善を区別することは、ハルシネーション測定における重要な論点となっている。

最も大きな低下は、知識労働の評価で確認された。SolはGDPval-AA v2.1で約100 Eloポイント低下し、Lunaは約75ポイント低下した。手動検証では、必要な評価基準の要素を省いた短い成果物や、提示品質の低下がスコア低下の要因とされた。OpenAIの数値と合わせて見ると、独立テストの結果は今回の発表を主にコスト面のニュースとして位置付けている。価格は全体的に低下した一方、能力の変化はベンチマークやタスク分野によって異なった。