xAI历经多次延期发布Grok 4.7,基准测试落后于前沿竞争对手
要点速览
- •Grok 4.7拥有2.1万亿参数,较Grok 4.6的1.5万亿增加40%,定价为每百万输入tokens 2美元、每百万输出tokens 6美元。
- •xAI以SpaceX数据补充模型训练,包括Starlink卫星遥测数据、制造记录和工程故障日志,旨在提升对硬件和物理系统的推理能力。
- •早期基准测试显示,Grok 4.7在GDPval上(1695对1735)和AA-Briefcase上(1657对1678)排名第二,仅次于Claude Fable 5.1;在EEBench电气工程测试上仅次于GPT-6 Astra。
- •此次发布此前至少经历了五次时间调整(自7月下旬起),模型已立即上线,无需等候名单,可通过Grok应用、Cursor、Grok Build和xAI API使用。
- •MuskGrok 4.7应大致与Anthropic的Claude Opus 5.0处于同等水平,并勾勒了即将推出的模型——Grok 4.8、Grok 4.9以及可能领先前沿的Grok 5——但未确定发布日期。

Elon Musk旗下的xAI于周一下午发布Grok 4.7,这是该公司迄今最强大的模型,官方称其为“在相同价格和速度下对Grok 4.6的显著改进”。
早期基准测试结果显示,该模型在GDPval和AA-Briefcase上排名第二,仅次于Claude Fable 5.1;在电气工程基准测试EEBench上排名第二,仅次于GPT-6 Astra。
此次发布之前经历了一连串的延期。自7月下旬以来,Musk至少五次推迟发布时间表:先是“四周后”,然后是“几周”,接着是“3到4周”,9月1日称“还有10天”,最后在9月11日称“还需要几天时间打磨”。
这一次没有等候名单。Grok 4.7已立即上线,可通过Grok应用、Cursor、Grok Build和xAI API使用。
Musk随后在X上跟进,称Grok 4.7是“智能、速度与低成本的强力组合”。
Grok 4.7 is here. It's a notable improvement over Grok 4.6 at the same price and speed. pic.twitter.com/H3OTBbXyvO
根据xAI的官方公告,与Grok 4.6相比,该模型会花更长时间攻克难题,并更频繁地复核自己的答案,同时还配备了该公司所称的迄今最强大的安全防护机制。
规模、定价与SpaceX数据
Grok 4.7拥有2.1万亿参数,较Grok 4.6的1.5万亿增加40%,而Grok 4.6本身是对Grok 4.5的改进。定价为每百万输入tokens 2美元、每百万输出tokens 6美元。参数是模型在训练过程中调节的内部旋钮,参数越多通常意味着学习模式的能力越强,而tokens则是AI模型能够接收或生成的信息基本单位。
xAI还纳入了来自Musk旗下火箭公司SpaceX的补充训练数据:Starlink卫星遥测数据、制造记录和工程故障日志。其卖点是,相比任何仅通过互联网文本训练的模型,该模型对硬件和物理系统的推理能力更强。
基准测试讲述了一个熟悉的故事
GDPval衡量模型在真实、具有经济价值的知识工作上的表现——包括法律备忘录、电子表格和幻灯片——所用任务均经过各领域在职专业人士审核,并以Elo评分计分,Elo正是国际象棋所用的对战排名系统。Grok 4.7在GDPval上得分为1695,而Claude Fable 5.1以1735高居榜首——在Elo量表上相差40分。
AA-Briefcase由Artificial Analysis构建,测试将研究、分析和文档产出串联为一项长任务的多小时办公工作,同样采用Elo量表计分。Grok 4.7得分为7,低于Fable 5.1的1678——差距较窄,为21分,不同的测试得到了相同的结果。
CursorBench 4.0是Cursor针对其编辑器内真实编码任务的基准测试,将准确率与每项任务消耗的成本和tokens数量进行对比。Grok 4.7位居中游:每项任务的成本高于GPT-6 Astra(GPT-5.6 Sol的继任者)和Claude Sonnet 5,但仍不及Fable 5.1——后者在图表上所有价格点均胜出。
xAI的惯常模式
该公司已多次发布在独立评估中落后于竞争对手的旗舰模型。Grok 4.5于7月发布,拥有业内最大的训练集群,但得分位列第三,落后于Claude和OpenAI的模型。在此之前,Grok 4.20以可靠性换取速度和个性化,Grok 4.6在编码自主性方面也落后于前沿阵营。
这些都不足以让Grok 4.7成为一款糟糕的产品,对于通过X、独立应用或特斯拉仪表盘与其对话的数百万用户而言。它只是意味着,最有可能回答用户问题——或驱动汽车语音助手——的模型,所运行的系统按其制造商自己的基准测试衡量,比梯队顶端低了一级。
正是这一差距使得对大多数人而言,价格比排行榜名次更为重要。xAI在每tokens成本上一直低于Anthropic和OpenAI,即便其原始能力落后于对方,它押注的是“够用、便宜、无处不在”在日常使用中胜过“最好但更贵”。
Musk的预期与未来之路
Musk在发布前几天就已降低了预期,在X上写道,Grok 4.7应“大致与”Anthropic的Claude Opus 5.0“处于同等水平”——而非更新的Opus 5.1——多模态性能仍需改进。
在同一篇帖子中,他勾勒了接下来的三个模型:Grok 4.8作为一次有意义的跃升,Grok 4.9达到“Astra/Fable级”,Grok 5则可能成为前沿领导者。这些升级尚未确定发布日期——鉴于Grok 4.7本身的时间表在发布前至少被推迟了五次,这一细节显得格外意味深长。“我们拭目以待,”他写道。