马斯克的SpaceXAI发布Grok 4.7,DeepSWE基准得分达71%
要点速览
- •SpaceXAI于9月21日发布Grok 4.7,称其为公司在编码与知识工作方面迄今最强的模型,训练重点放在需要数小时才能完成的任务上。
- •该模型发布定价为每百万输入token 2美元、每百万输出token 6美元,与Grok 4.6相同,远低于GPT-5.6 Sol的4/20美元和Fable 5.1的10/50美元。
- •根据SpaceXAI公布的基准数据,Grok 4.7在DeepSWE v1.1上得分71.0%,将Terminal-Bench 4.0从前代的20.3%提升至38.0%,并在EEBench和Harvey法律智能体基准上领先,但在CursorBench 4.0和HealthBench Professional上落后于Fable 5.1。
- •重建后的安全体系在HackerBench v0.3中拦截了除3.3%之外的全部高风险双用途提示,误拒很少,部分网络安全合作伙伴获得了仅限邀请的红队访问权限。
- •发布前数小时,Grok 4.6的三个配置在Ben Swerdlow的Brood War Bench中输给了所有Codex和Claude配置,最好成绩为18场中胜2场,而Grok 4.7尚未参与排名。

Grok 4.7瞄准多小时级工作负载
马斯克旗下的人工智能部门SpaceXAI于9月21日发布Grok 4.7,称其为公司在编码与知识工作方面迄今最强大的模型。根据官方公告,新系统基于比Grok 4.6更大的基础模型,并在更难的任务组合上经历了更长的强化学习周期,特别侧重于需要数小时才能完成的问题。
该公司围绕“持久力”来定位这次发布。以往的模型在几分钟内给出回答,而Grok 4.7则被调校为能够持续完成原本需要人类工程师或分析师数小时才能处理的工作。SpaceXAI表示,该模型在长时间运行中的自我输出验证、超长上下文窗口(即模型一次能保持在“工作视野”中的文本量)处理以及原生运行Grok Bot智能体框架方面均有显著提升——智能体框架是一种多步骤设置,模型在其中自主规划、调用工具并执行工作,而非仅回答单个提示——这些升级体现在对话、通用知识任务以及专业文档和演示文稿的生成中。
在公布的基准测试中,xhigh配置已接近前沿水平。在软件工程测试套件DeepSWE v1.1上,Grok 4.7得分71.0%,略胜得分70.0%的Fable 5.1 max,仅次于得分72.7%的GPT-5.6 Sol max。在评估多小时终端工作的Terminal-Bench 4.0上,该模型从前代产品的20.3%跃升至38.0%。在模拟律师、护士和金融分析师多小时专业工作的测试套件(包括AA Briefcase和HealthBench)中,SpaceXAI表示Grok 4.7已与业界最优秀的产品处于同一水平。
安全性是另一项重点宣称。重建后的安全体系使这一版本成为公司迄今在拒绝不当请求和抵御越狱(即试图绕过模型安全防护的行为)方面最坚固的版本。在测试恶意网络任务的HackerBench v0.3中,仅有3.3%的高风险双用途提示(即同时具有合法与有害用途的请求)通过了防线,且对合法的防御性安全工作误拒很少。网络安全合作伙伴已获得仅限邀请的红队访问权限——即安全研究人员探测系统弱点的对抗性测试——以支持防御研究。
该模型现已通过Cursor、Grok Build、Grok API、主要云平台和模型路由器(即将开发者的请求通过统一接口转交至其选择的任意AI模型的服务)正式上线。
定价维持2美元之际,Brood War Bench令Grok 4.6蒙羞
定价是低调的亮点:Grok 4.7发布价格为每百万输入token 2美元、每百万输出token 6美元——与Grok 4.6完全相同——另有一个输出速度加倍、价格也翻倍的快速版本。Token是语言模型读取和生成的文本单位,API计费即按此计量:输入计费涵盖开发者发送的内容,输出计费涵盖模型写回的内容。这一价格大幅低于竞争对手:GPT-5.6 Sol定价为每百万token 4/20美元,Fable 5.1为10/50美元,使Grok的费率约为竞品水平的三分之一至一半,且交付速度更快。
SpaceXAI自己的对比表显示,Grok 4.7在电气工程(EEBench:64.0%,GPT-5.6 Sol为39.4%,Fable 5.1为56.4%)和Harvey法律智能体基准(19.6%,对手分别为2.5%和6.7%)上领先,而在软件工程(CursorBench 4.0:46.3%,Fable 5.1为51.8%)和临床推理(HealthBench Professional:56.7%,对手为62.1%)上落后于Fable 5.1。以上所有数据均来自SpaceXAI公布的数据。
公司背景同样值得关注:SpaceXAI于今年2月形成现有架构,当时xAI并入SpaceX,随后在6月收购了Cursor——这款AI代码编辑器同时也是Grok 4.7的发布渠道之一——这一切都属于马斯克的商业版图,其中还包括特斯拉(TSLA),并且据此前报道,马斯克计划在数周内整合其AI订阅计划。
不过在发布前数小时,一项众包基准测试给前代产品带来了打击。开发者Ben Swerdlow的Brood War Bench——由AI智能体对战《星际争霸:母巢之战》——于9月20日在X上传播:来自Codex、Claude和Grok的19个配置进行了171场对战,Codex Astra以最高推理等级横扫其全部18场比赛。Grok 4.6的三个配置则输给了所有Codex和Claude配置,最好成绩为18场中仅胜2场。实时战略对智能体是一项严苛的考验,因为经济、生产和战斗决策都在持续到来——没有可供暂停和规划的回合。
Swerdlow记录了一场对局,其中最高推理等级的Grok配置在43分钟内消耗11,138个推理token,却只发出了六批指令——始终没有派出哪怕一个作战单位。他写道,Grok在智能上尚不足以驾驭这款游戏,旧模型将实时战略当作回合制来处理,并补充说没有任何参赛者超过新手水平。Grok 4.7尚未参与排名。
COINOTAG观点:定价压力才是真正的信号
综合来看,发布当日的亮眼数据与Brood War的惨败讲述的是同一个故事:前沿实验室如今以大众化价格出售推理能力,而智能体的可靠性——而非静态基准分数——才决定胜负。COINOTAG认为,2/6美元的定价方案为Grok 4.7赋予了竞争对手必须跟上的代币经济学,正如期货定价迫使市场重新锚定预期一样,而缺乏同等算力的实验室则可能在这场价格战中沦为“退出流动性”。该媒体还补充说,历史上马斯克算力相关的头条新闻曾影响过狗狗币(DOGE)等与马斯克关联资产的市场情绪,并建议关注Grok 4.7的智能体实际表现,而非其发布时的宣称。