xAI 发布 Grok 4.7:新增安全防护机制,多小时任务性能提升
要点速览
- •Grok 4.7 基于全新、规模更大的基础模型构建,并通过使用更困难任务的扩展强化学习训练而成,xAI 称这提升了代码生成、长上下文处理和自我验证能力。
- •模型最大的基准提升出现在长时间运行的编程和终端任务上,Terminal-Bench 4.0 从 20.3% 升至 38.0%,CursorBench .0 从 40.4% 升至 46.3%。
- •Grok 4.7 搭载全新安全防护机制,xAI 称其为测试过的在拒答行为和抗越狱方面最强的版本,并以 62.4% 的得分领跑 LatchBio 生物安全基准。
- •价格维持在 Grok 4.6 水平:每百万输入代币 2 美元、每百万输出代币 6 美元,低于 GPT-5.6 Sol 和 Fable 5.1 的费率。
- •Artificial Analysis 在其 Intelligence Index 上给 Grok 4.7 打出 46 分,提升两分并使 SpaceXAI 位居四大 AI 实验室之列,但发现该模型每任务消耗约 81,000 个输出代币,是 Grok 4.6 的 36,000 个的两倍多,推高了实际成本。

xAI 发布了 Grok 4.7,称其为迄今为止在编程和知识工作方面最强大的模型。该公司将该模型定位为具有竞争力的前沿产品,价格与上一代 Grok 4.6 保持一致。
Grok 4.7 基于全新、规模更大的基础模型构建,并通过使用更困难任务组合的扩展强化学习训练而成,任务组合侧重于需要数小时才能完成的问题。据 xAI 称,训练方面的改进提升了代码生成、长上下文处理和自我验证能力。该模型还原生理解 Grok Bot harness,公司表示这使其在对话任务和一般知识工作中更为高效。
据报道,最大的提升集中在运行时间较长的编程和终端任务上。在 CursorBench 4.0 上,Grok 4.7 得分为 46.3%,而 Grok 4.6 为 40.4%。其得分超过 GPT-5.6 Sol 的 41.7%,但仍低于 Fable 5.1 的 51.8%。在 DeepSWE v1.1 高强度模式下,Grok 4.7 得分 71.0%,落后于 GPT-5.6 Sol 的 72.7%,但略高于 Fable 5.1 的 70.0%。
该模型在 GDPval 和 AA Briefcase 上也优于 Grok 4.6,后者评估律师、护士和金融分析师等专业人士完成的多小时办公任务。在 AA Briefcase 上,Grok 4.7 得分 1,657,接近 Fable 5.1 的 1,678。最显著的基准提升出现在衡量多小时终端工作的 Terminal-Bench 4.0 上。Grok 4.7 的得分从 Grok 4.6 的 20.3% 升至 38.0%。
在涵盖高风险网络任务的 HackerBench v0.3 上,该模型仅放行了 3.3% 的危险双用途提示,同时很少阻止合法的安全工作。
Grok 4.7 is here. It's a notable improvement over Grok 4.6 at the same price and speed. pic.twitter.com/H3OTBbXyvO — SpaceXAI (@SpaceXAI) September 21, 2026
https://x.com/SpaceXAI/status/2102069815225586149?ref_src=twsrc%5Etfw
全新安全防护机制与维持不变的价格
本次发布的一个核心特点是 Grok 4.7 的安全防护机制,xAI 称其为全新打造,是其测试过的在拒答行为和抗越狱方面最强的版本。该模型在 LatchBio 的生物安全基准上以 62.4% 的得分领先,在网络安全和生物研究等双用途领域中,既能在良性任务上保持性能,又能安全拒绝危险请求。xAI 还开始向选定的网络安全合作伙伴提供仅限邀请的访问权限,用于防御研究。
Grok 4.7 的价格与 Grok 4.6 相同:每百万输入代币 2 美元,每百万输出代币 6 美元。这一价格低于 GPT-5.6 Sol 的 4 美元和 20 美元,以及 Fable 5.1 的 10 美元和 50 美元。输出速度倍的快速版本价格亦翻倍。统一的按代币计费使表面价格对比一目了然,但长时间运行任务的总成本还取决于模型完成任务所消耗的代币数量。
在 CursorBench 的性价比前沿上,这一价格使 Grok 4.7 成为长时间编程工作负载中更具成本效益的选择之一。该模型现已在 Cursor 和 Grok Build 中可用,也可通过 Grok API、第三方编程 harness、模型路由器和云平台访问。
此次发布加剧了前沿模型提供商之间的竞争,除了表面基准分数外,各厂商越来越多地在长时间智能体任务、安全校准和单任务完成成本上进行比较。对于评估编程类模型的开发者和企业而言,Grok 4.7 将稳定的价格与更高的多小时任务得分以及新的安全防护相结合。
Artificial Analysis 证实性能提升,但指出代币消耗问题
独立基准测试机构 Artificial Analysis 也对 Grok 4.7 进行了评估,在 Intelligence Index 上给出 46 分。据该机构称,这比 Grok 4.6 高出两分,使 SpaceXAI 位居四大 AI 实验室之列。这一外部评估与 xAI 将此次发布定位为编程和知识工作领域进步的说法一致。
该评估采用 xhigh 推理强度进行,发现最明显的进展体现在长时程智能体知识工作上。在 Artificial Analysis 的私有 AA-Briefcase 基准上,Grok 4.7 比上一代提升了 111 个 Elo 点,达到 1,657,与 Claude Opus 5 和 Claude Fable 5.1 并列于前沿水平。这一提升主要由分析质量驱动,其 Elo 从 1,690 大幅升至 1,994。呈现质量基本保持稳定。
在衡量文档、电子表格和幻灯片等实际工作成果的 GDPval-AA 上,Grok 4.7 得分 1,695 Elo,提升了 90 分。
Grok 4.7 scores 46 on the Artificial Analysis Intelligence Index to bring SpaceXAI into the top 4 AI labs. Coding Agent Index performance has also improved, overtaking GPT-5.6 Sol Grok 4.7 scores +2 points over Grok 4.6 on the Intelligence Index, with strong performance on… pic.twitter.com/8p4KC6cgZy — Artificial Analysis (@ArtificialAnlys) September 21, 2026
https://x.com/ArtificialAnlys/status/2102074898327932987?ref_src=twsrc%5Etfw
Artificial Analysis 发现,性能提升需要显著更多的计算资源。在 xhigh 强度下,Grok 4.7 每个 Intelligence Index 任务消耗约 81,000 个输出代币,是 Grok 4.6 所用 36,000 个代币的两倍多,接近 GPT-6 Astra 在最大强度下消耗的 27,000 个代币的三倍。由于按代币计费标准未变,这一更高的消耗量推高了同类任务的实际成本,尽管表面价格保持不变。
该机构还报告了其他方面的温和改进,包括 Terminal-Bench 4.0 和 GDP.pdf 上的小幅提升,以及 AA-LCR 和 AutomationBench-AA 上的小幅退步。可靠性略有改善:AA-Omniscience 幻觉率从 34% 降至 29%,而准确率几乎维持在 47% 不变。
其他技术规格与上一代保持一致,包括 500,000 代币的上下文窗口。缓存命中价格折扣至每百万代币 0.50 美元。随着该模型在 Cursor、Grok Build、Grok API、第三方 harness、模型路由器和云平台上全面上线,开发者现在可以在自己的工作负载中权衡基准收益与更高的代币消耗。原始报道可从 Metaverse Post 获取。