ニュース株式xAI、度重なる遅延を経てGrok 4.7を公開—ベンチマークではフロンティアのライバルに及ばず

xAI、度重なる遅延を経てGrok 4.7を公開—ベンチマークではフロンティアのライバルに及ばず

著者: Decrypt·

重要ポイント

  • Grok 4.7は2.1兆のパラメータを使用し、Grok 4.6の1.5兆から40%増加。価格は入力100万トークンあたり2ドル、出力100万トークンあたり6ドル。
  • xAIは、Starlink衛星のテレメトリ、製造記録、エンジニアリングの障害ログなどSpaceXのデータでモデルの学習を補強し、ハードウェアや物理システムに関する推論の向上を狙った。
  • 初期のベンチマーク結果では、Grok 4.7はGDPval(1695対1735)とAA-Briefcase(1657対1678)でClaude Fable 5.1に、電気工学テストのEEBenchではGPT-6 Astraに次ぐ2位。
  • 公開は7月下旬以降少なくとも5回のリリース日程の変更を経たもので、待ちリストなしでGrokアプリ、Cursor、Grok Build、xAI APIですぐに利用可能になった。
  • マスク氏は、Grok 4.7がアンソロピックのClaude Opus 5.0とほぼ同等になるべきだと述べ、今後のモデル(Grok 4.8、Grok 4.9、そしてフロンティアをリードする可能性のあるGrok 5)について言及したが、リリース日は明示しなかった。
xAI、度重なる遅延を経てGrok 4.7を公開—ベンチマークではフロンティアのライバルに及ばず

イーロン・マスク氏のxAIは月曜午後、これまでで最も高性能なモデル「Grok 4.7」をリリースした。同社はこれを「同じ価格と速度でGrok 4.6から顕著な改善」と呼んでいる。

初期のベンチマーク結果では、このモデルはGDPvalとAA-BriefcaseでClaude Fable 5.1に、電気工学ベンチマークのEEBenchではGPT-6 Astraに次ぐ2位につけた。

今回の公開は、相次ぐ日程の延期を経てのものとなった。マスク氏は7月下旬以降、リリース時期を少なくとも5回引き下げてきた。「4週間後」、次に「数週間」、続いて「3〜4週間」、9月1日に「あと10日」、そして9月11日には「もう少し煮詰める必要がある」と述べていた。

今回は待ちリストはない。Grok 4.7はGrokアプリ、Cursor、Grok Build、xAI APIですぐに利用可能だ。

マスク氏はXでその後投稿し、Grok 4.7を「知性、速度、低コストの強力な組み合わせ」と評した。

Grok 4.7 is here. It's a notable improvement over Grok 4.6 at the same price and speed. pic.twitter.com/H3OTBbXyvO

SpaceXAI (@SpaceXAI) September 21, 2026

xAIの公式発表によるとこのモデルは難しい問題の処理により長い時間をかけ、Grok 4.6よりも自分の回答をより頻繁に再確認するという。さらに同社はこれを「これまでで最も強力な安全ガードレール」と位置づけている。

スケール、価格、SpaceXデータ

Grok 4.7は2.1兆のパラメータを搭載しており、Grok 4.6の1.5兆から40%増加した。Grok 4.6自体がGrok 4.5の改良版だった。価格は入力100万トークンあたり2ドル、出力100万トークンあたり6ドルに設定されている。パラメータとはモデルが学習中に調整する内部のノブであり、多いほど一般的にパターンを学習する capacity が大きくなる。トークンはAIモデルが受け取ったり生成したりできる情報の基本単位だ。

xAIはまた、マスク氏のロケット企業SpaceXから取得した追加学習データを組み込んだ。Starlink衛星のテレメトリ、製造記録、エンジニアリングの障害ログなどだ。狙いは、インターネット上のテキストのみで学習したモデルよりも、ハードウェアや物理システムについてより適切に推論できるモデルだ。

ベンチマークが示す見慣れた構図

GDPvalは、法務メモ、スプレッドシート、スライド資料といった実際の経済的価値のある知的業務でモデルがどのように機能するかを測定するもので、各分野の実務専門家が検証したタスクを用い、チェスと同じ対戦型ランキングシステムであるEloレーティングで採点される。Grok 4.7はGDPvalで1695を記録した一方、Claude Fable 5.1は1735で首位だった。Eloスケールで40ポイントの差だ。

Artificial Analysisが構築したAA-Briefcaseは、リサーチ、分析、ドキュメント作成を一つの長いタスクとしてつなげた数時間規模のオフィスワークをテストするもので、これもEloスケールで採点される。Grok 4.7は1657、Fable 5.1は1678と、差は21ポイントに縮まったが、結果は同じでテストが違うだけだ。

Cursorのエディタ内での実際のコーディングタスク向けベンチマークであるCursorBench 4.0は、精度を各タスクのコストとトークン消費量に対してプロットする。Grok 4.7は中間に位置する。GPT-5.6 Solの後継であるGPT-6 AstraやClaude Son 5よりタスクあたりの価格は高いが、あらゆる価格帯で勝つFable 5.1には及ばない。

xAIに繰り返されるパターン

同社はこれまで、独立系の評価でライバルに出遅れたフラッグシップモデルを繰り返し投入してきた。Grok 4.5は7月、業界最大の学習クラスターを擁して登場したが、ClaudeとOpenAIのモデルに次ぐ3位のスコアだった。その前のGrok 4.20は信頼性を速度と個性と引き換えにし、Grok 4.6もコーディングの自律性ではフロンティア勢に後れを取っていた。

ただ、X、単体アプリ、テスラのダッシュボードを通じて利用する数百万のユーザーにとって、このことがGrok 4.7を劣った製品にしているわけではない。意味するところは、ユーザーの質問に答えたり車の音声アシスタントを動かしたりする可能性が最も高いモデルが、開発元自身のベンチマークで頂点から一段下に位置づけられるシステム上で動いている、ということだ。

多くの人にとっては、この差こそがリーダーボードの順位よりも価格の方が重要である理由だ。xAIは生の性能ではアンソロピックやOpenAIに後れを取りながらも、トークンあたりのコストで一貫してこれらを下回っており、「十分で、安くて、どこにでもある」方が「最高だが高価な」ものより日常用途の大半を勝ち取れるという賭けに出ている。

マスク氏の期待と今後の道筋

マスク氏は公開数日前にすでに期待値を下げており、Xへの投稿で、Grok 4.7は新しいOpus 5.1ではなくアンソロピックのClaude Opus 5.0と「ほぼ同等」になるはずだと述べ、マルチモーダル性能はまだ改善が必要だと書いていた。

同じ投稿の中で、マスク氏は次の3つのモデルについても言及した。大きな進化を遂げるGrok 4.8、「Astra/Fable級」のGrok 4.9、フロンティアのリーダーになる可能性があるGrok 5だ。これらのアップグレードのリリース日はまだ決まっていない。Grok 4.7自体が公開までに少なくとも5回も日程を引き下げられたことを考えれば、これはとりわけ重みを持つ点だ。「結果を見てみよう」と彼は書いた。