xAI、新セーフガード体制を備えたGrok 4.7をリリース — 長時間タスク性能が向上し、価格は据え置き
重要ポイント
- •Grok 4.7は新たにより大規模な基盤モデルの上に構築され、より難易度の高いタスクを用いた拡張された強化学習ランで訓練されており、xAIはこれによりコード生成、長文コンテキスト処理、自己検証が向上したとしている。
- •最大のベンチマーク向上は長時間のコーディングおよびターミナル作業で見られ、Terminal-Bench 4.0は20.3%から38.0%に、CursorBench 4.0は40.4%から46.3%に上昇した。
- •Grok 4.7は完全に新しい安全スタックを搭載しており、xAIは拒否挙動とジェイルブレイク耐性についてこれまでテストした中で最強としており、LatchBioのバイオセーフティベンチマークで62.4%で首位である。
- •価格はGrok 4.6と同水準の入力100万トークンあたり2ドル、出力100万トークンあたり6ドルで維持され、GPT-5.6 SolおよびFable 5.1の料金を下回る。
- •Artificial AnalysisはGrok 4.7をIntelligence Indexで46と評価し、2ポイントの向上によりSpaceXAIは上位4つのAIラボに位置付けられたが、モデルはタスクあたり約81,000出力トークンを消費しており、Grok 4.6の36,000の2倍以上で、実質コストが上昇していることが判明した。

xAIはGrok 4.7をリリースし、コーディングおよび知識作業向けにこれまでで最も高性能なモデルであると説明している。同社はこのモデルを競争力のある価格で提供するフロンティアモデルとして位置付けており、価格は前世代のGrok 4.6から変更されていない。
Grok 4.7は新たにより大規模な基盤モデルの上に構築され、完了までに多くの時間を要する問題に重点を置いた、より難易度の高いタスクミックスを用いた拡張された強化学習ランを通じて訓練された。xAIによると、この訓練上の変更により、コード生成、長文コンテキスト処理、および自己検証能力が向上している。また、モデルはGrok Botハーネスをネイティブに理解し、同社はこれにより会話タスクや一般的な知識作業での有効性が高まっているとしている。
報告された最大の性能向上は、より長時間のコーディングおよびターミナルタスクに集中していた。CursorBench 4.0では、Grok 4.7は46.3%を記録し、Grok 4.6の40.4%を上回った。このスコアはGPT-5.6 Solの41.7%を超えたものの、Fable 5.1の51.8%には及ばなかった。DeepSWE v1.1では高負荷設定で71.0%を記録し、GPT-5.6 Solの72.7%には劣ったものの、Fable 5.1の70.0%をずかに上回った。
また、モデルはGDPvalおよびAA BriefcaseにおいてGrok 4.6から改善した。AA Briefcaseは、弁護士、看護師、金融アナリストなどの専門家が行う数時間に及ぶオフィス作業を評価するものであり、Grok 4.7は1,657を記録し、Fable 5.1の1,678に近い結果となった。最も顕著なベンチマーク上の上昇は、数時間に及ぶターミナル作業を測定するTerminal-Bench 4.0で見られた。Grok 4.7のスコアはGrok 4.6の20.3%から38.0%に上昇した。
リスクの高いサイバータスクを対象とするHackerBench v0.3では、モデルは危険なデュアルユースプロンプトの3.3%のみを通過させ、正当なセキュリティ作業を妨げることはほとんどなかった。
Grok 4.7 is here. It's a notable improvement over Grok 4.6 at the same price and speed. pic.twitter.com/H3OTBbXyvO — SpaceXAI (@SpaceXAI) September 21, 2026
https://x.com/SpaceXAI/status/2102069815225586149?ref_src=twsrc%5Etfw
新しい安全スタックと据え置きの価格
今回のリリースの中心的な特徴はGrok 4.7の安全スタックであり、xAIはこれを完全に新しく、拒否挙動およびジェイルブレイク耐性についてこれまでテストした中で最強のものであると説明した。モデルはLatchBioのバイオセーフティベンチマークで62.4%のスコアで首位に立ち、サイバーセキュリティや生物学研究などのデュアルユース分野において、良性タスクでの性能と危険な要求に対する拒否を両立させている。xAIはまた、防御研究を目的として、選ばれたサイバーセキュリティパートナーに対し、モデルのレッドチーム機能への招待制アクセスの提供を開始した。
Grok 4.7の価格はGrok 4.6と同じく、入力トークン100万あたり2ドル、出力トークン100万あたり6ドルである。これらの料金は、それぞれGPT-5.6 Solの4ドルおよび20ドル、Fable 5.1の10ドルおよび50ドルを下回る。出力速度が2倍の高速バリアントは2倍の価格で提供される。トークン単位の一律料金により表向きの価格比較は単純になるが、長時間の作業の総コストは、モデルがタスクを完了するために消費するトークン量にも依存する。
CursorBenchの価格性能フロンティアにおいて、この価格設定はGrok 4.7を長時間のコーディングワークロードに対するより費用対効果の高い選択肢の一つに位置付けている。モデルはCursorおよびGrok Buildで即日利用可能となっており、Grok API、サードパーティのコーディングハーネス、モデルルーター、クラウドプラットフォームを通じてもアクセスが提供されている。
今回のリリースは、フロンティアモデルプロバイダーの競争をさらに激化させる。各社は、見出しとなるベンチマークスコアに加え、長時間のエージェント的タスク、安全性の調整、タスク完了あたりのコストでシステムを比較するようになってきている。コーディング指向のモデルを評価する開発者や企業にとって、Grok 4.7は安定した価格設定と、より高い数時間規模タスクのスコア、そして新しいセーフガードを組み合わせている。
Artificial Analysis、性能向上を確認するもトークン消費を指摘
独立系ベンチマーク企業のArtificial AnalysisもGrok 4.7を評価し、Intelligence Indexで46のスコアを付けた。これはGrok 4.6より2ポイント高く、同社によればSpaceXAIを上位4つのAIラボに位置付ける結果となった。第三者によるこの評価は、コーディングおよび知識作業における前進としての今回のリリースに関するxAIの位置付けと一致している。
評価はxhighの推論負荷で実施され、最も明確な進歩は長時間に及ぶエージェント的な知識作業で確認された。Artificial Analysisの非公開ベンチマークAA-Briefcaseにおいて、Grok 4.7は前世代から111 Eloを獲得して1,657に達し、フロンティアにおいてClaude Opus 5およびClaude Fable 5.1と並ぶ位置となった。この上昇は主に分析品質の向上によるもので、1,690から1,994 Eloに上昇した。提示品質はほぼ安定していた。
文書、スプレッドシート、スライドなどの実務成果物を測定するGDPval-AAでは、Grok 4.7は1,695 Eloを記録し、90ポイントの上昇となった。
Grok 4.7 scores 46 on the Artificial Analysis Intelligence Index to bring SpaceXAI into the top 4 AI labs. Coding Agent Index performance has also improved, overtaking GPT-5.6 Sol Grok 4.7 scores +2 points over Grok 4.6 on the Intelligence Index, with strong performance on… pic.twitter.com/8p4KC6cgZy — Artificial Analysis (@ArtificialAnlys) September 21, 2026
https://x.com/ArtificialAnlys/status/2102074898327932987?ref_src=twsrc%5Etfw
Artificial Analysisは、性能向上に大幅に多くの計算資源が必要であったことを明らかにした。xhigh負荷において、Grok 4.7はIntelligence Indexのタスクあたり約81,000出力トークンを消費した。これはGrok 4.6が使用した36,000トークンの2倍以上、最大負荷でのGPT-6 Astraが消費した27,000トークンの約3倍である。トークン単位の料金は変更されていないため、この増加した消費により、表向きの価格が据え置きであっても、同等のタスクの実質コストは上昇している。
同社は、Terminal-Bench 4.0およびGDP.pdfでの緩やかな追加改善、ならびにAA-LCRおよびAutomationBench-AAでの小幅な後退も報告した。信頼性も緩やかに改善し、AA-Omniscienceのハルシネーション率は34%から29%に低下した一方、正解率は47%でほぼ変わらなかった。
その他の技術仕様は前世代と同一であり、変更のない500,000トークンのコンテキストウィンドウが含まれる。キャッシュヒット価格は100万トークンあたり0.50ドルに割り引かれている。がCursor、Grok Build、Grok API、サードパーティハーネス、モデルルーター、クラウドプラットフォームで利用可能となったことで、開発者は自らのワークロードにおいて、ベンチマーク上の向上と増加したトークン消費を比較検討できるようになった。原文はMetaverse Postで入手可能である。