ニュース株式イーロン・マスクのSpaceXAI、DeepSWEベンチマーク71%のGrok 4.7を発表

イーロン・マスクのSpaceXAI、DeepSWEベンチマーク71%のGrok 4.7を発表

著者: Coinotag·

重要ポイント

  • SpaceXAIは9月21日にGrok 4.7をリリースし、完了まで数時間を要するタスクに訓練を重点に置いた、同社史上最強のコーディング・ナレッジワーク向けモデルと位置づけた。
  • 価格は入力トークン100万あたり2ドル、出力トークン100万あたり6ドルでGrok 4.6と同一。GPT-5.6 Solの4ドル/20ドル、Fable 5.1の10ドル/50ドルを大きく下回る。
  • SpaceXAIの公開ベンチマークでは、Grok 4.7はDeepSWE v1.1で71.0%を記録し、Terminal-Bench 4.0を前モデルの20.3%から38.0%に引き上げ、EEBenchとHarveyリーガルエージェントベンチマークで首位となった一方、CursorBench 4.0とHealthBench ProfessionalではFable 5.1を下回った。
  • 再構築されたセーフティスタックはHackerBench v0.3で高风险なデュアルユースプロンプトのうち3.3%のみを通過させ、誤拒否は少なく、一部のサイバーセキュリティパートナーには招待制のレッドチームアクセスが付与された。
  • リリース数時間前、Grok 4.6の3構成はBen SwerdlowのBrood War BenchでCodexおよびClaudeの全構成に敗れ、最良の成績は18戦中2勝。Grok 4.7はまだランク付けされていない。
イーロン・マスクのSpaceXAI、DeepSWEベンチマーク71%のGrok 4.7を発表

Grok 4.7、数時間規模のワークロードを狙う

イーロン・マスクのAI部門であるSpaceXAIは9月21日、コーディングとナレッジワーク向けに同社史上最も高性能なモデルと位置づけるGrok 4.7を発表した。公式発表によると、新システムはGrok 4.6よりも大規模なベースモデル上で動作し、より難度の高いタスクミックスで長時間の強化学習サイクルを経ており、完了まで数時間を要する問題に意図的に重点を置いているという。

同社は今回のリリースを「持久力」を軸に位置づけている。従来のモデルが数分で回答していたところ、Grok 4.7は人間のエンジニアやアナリストを数時間拘するような作業を掘り進めるよう調整されている。SpaceXAIによれば、このモデルは時間の実行における自己出力の検証、非常に長いコンテキストウィンドウ(モデルが一度に作業視野に保持できるテキスト量)の処理、そしてGrok Botエージェントフレームワークのネイティブな運用(モデルが単一のプロンプトに答えるのではなく、計画し、ツールを呼び出し、自ら作業を実行するマルチステップ構成)が大幅に向上しており、その改善は会話、一般知識タスク、そして専門的な文書やプレゼンテーションの生成に表れているという。

公開ベンチマークでは、xhigh構成がフロンティアに迫る成績を示した。ソフトウェアエンジニアリングスイートであるDeepSWE v1.1で、Grok 4.7は71.0%を記録し、70.0%のFable 5.1 maxを上回り、727%のGPT-5.6 Sol maxにのみ及ばなかった。数時間規模のターミナル作業を評価するTerminal-Bench 4.0では、前モデルの20.3%から38.0%へと跳ね上がった。弁護士、看護師、金融アナリスト向けの数時間規模の専門業務をシミュレートするスイート(AA BriefcaseやHealthBenchなど)では、SpaceXAIはGrok 4.7が業界最高水準に並んだと述べている。

安全性ももう一つの目玉だ。再構築されたセーフティスタックにより、不適切な要求の拒否およびジェイルブレイク(モデルの安全策を言い負かして突破する試み)への耐性において、同社史上最も堅牢なバージョンとなっている。悪意あるサイバー任務を試験するHackerBench v0.3では、正当な用途と有害な用途の両面を持ちうる高风险なデュアルユースプロンプトのうち、通過したのはわずか3.3%で、正当な防御的セキュリティ業務の誤拒否は少なかった。一部のサイバーセキュリティパートナーには、防衛研究を支援するため、セキュリティ研究者がシステムの弱点を探る敵対的テストである招待制のレッドチームアクセスが付与された。

モデルは現在、Cursor、Grok Build、Grok API、主要クラウドプラットフォーム、そして開発者の要求を単一インターフェースを通じて任意のAIモデルへ振り分けるモデルルーターを通じて利用可能となっている。

2ドル価格の据え置きの中、Brood War BenchがGrok 4.6を大敗させる

価格は静かな定数だ。Grok 4.7入力トークン100万あたり2ドル、出力トークン100万あたり6ドル(Grok 4.6と同一)で登場し、さらに出力速度を2倍にする代わりに価格も2倍の高速バリアントが用意されている。トークンは言語モデルが読み書きするテキストの単位であり、APIの課金はこれを基に計測される。入力は開発者が送信する分、出力はモデルが書き戻す分をカバーする。この料金は競合を大きく下回る。GPT-5.6 Solはトークン100万あたり4ドル/20ドル、Fable 5.1は10ドル/50ドルと提示されており、Grokの価格は競合の約3分の1から2分の1で、しかもより高速に提供される。

SpaceXAI自身の比較表によると、Grok 4.7は電気工学(EEBench:64.0%対GPT-5.6 Solの39.4%、Fable 5.1の56.4%)およびHarveyリーガルエージェントベンチマーク(19.6%対2.5%、6.7%)で首位に立ち、一方でソフトウェアエンジニアリング(CursorBench 4.0:46.3%対51.8%)と臨床推論(HealthBench Professional:56.7%対62.1%)ではFable 5.1を下回っている。数値はすべてSpaceXAIの公開データに基づく。

企業面の背景も重要だ。SpaceXAIが現在の形になったのは2月、xAIがSpaceXに統合された時であり、その後6月にCursor(Grok 4.7のローンチチャネルの一つでもあるAIコードエディタ)を買収した。これはテスラ(TSLA)に及ぶマスク帝国の一部であり、以前の報道によれば、数週間以内にAIサブスクリプションプランを統合する動きの一環でもある。

ただし、リリースの数時間前、クラウドソースのベンチマークが前モデルの評価を傷つけた。開発者Ben SwerdlowによるBrood War Bench(AIエージェントがStarCraft: Brood Warをプレイする)が9月20日にXで拡散された。Codex、Claude、Grokの19構成が171回の対戦を行い、Codex Astraは最大推論設定で18試合すべてを圧勝した。Grok 4.6の3構成はCodexおよびClaudeの全構成に敗れ、最良の成績は18戦中2勝だった。リアルタイムストラテジーは、経済、生産、戦闘の意思決定が絶え間なく連続して発生し、立ち止まって計画する「ターン」が存在しないため、エージェントにとって厳しい試練となる。

Swerdlowは、最高推論のGrok構成が43分間で11,138の推トークンを消費しながら、発したコマンドバッチはわずか6回で、戦闘ユニットを一つも展開しなかった一戦を記録した。彼は、Grokはまだこのゲームに対応できるほど賢くなく、旧モデルはリアルタイムストラテジーをターン制として扱っていると述べ、どの参加者も初心者レベルを超えられなかったと付け加えた。Grok 4.7はまだランク付けされていない。

COINOTAGの見解:本当のシグナルは価格圧力

ローンチ時の数値とBrood Warの敗北を併せて見ると、一つの物語が読み取れる。フロンティアラボは今や推論をコモディティ価格で販売しており、勝敗を決めるのは静的なベンチマークスコアではなく、エージェントとしての信頼性だ。COINOTAGの評価では、2ドル/6ドルの料金設定は競合が一致せざるを得ないGrok 4.7のトークノミクスをもたらし、先物価格が市場に期待の再アンカーを強いるのと同様の効果を持つ。一方、同等の計算資源を持たないラボは、この価格戦争でエグジット・リクイディティ(退場の流動性)になるリスクを負う。同メディアはさらに、マスクの計算資源に関する見出しが歴史的にドージコイン(DOGE)などマスク連動資産のセンチメントを動かしてきたとし、ローンチ時の主張ではなくGrok 4.7のエージェント実績を注視すべきだと助言している。