新聞宏觀經濟xAI 推出 Grok 4.7:新增防護機制並提升多小時任務表現

xAI 推出 Grok 4.7:新增防護機制並提升多小時任務表現

作者: Metaverse Post·

重點速覽

  • •Grok 4.7 建構於全新且更大的基礎模型之上,並透過使用更困難任務的延伸強化學習訓練而成,xAI 表示這提升了程式碼生成、長上下文處理與自我驗證能力。
  • •該模型最大的基準測試進步來自長時間的程式編寫與終端機工作,Terminal-Bench 4.0 從 20.3% 升至 38.0%,CursorBench 4.0 從 40.4% 升至 46.3%。
  • •Grok 4.7 搭載全新安全架構,xAI 稱其為測試過在拒答行為與越獄抵抗方面最強的版本,並在 LatchBio 生物安全基準測試中以 62.4% 領先。
  • •定價維持 Grok 4.6 水準,每百萬輸入 token 2 美元、每百萬輸出 token 6 美元,低於 GPT-5.6 Sol 與 Fable 5.1 的費率。
  • •Artificial Analysis 在 Intelligence Index 上給 Grok 4.7 評分 46 分,兩分的進步使 SpaceXAI 晉身四大 AI 實驗室,但發現該模型每項任務使用了約 81,000 個輸出 token,超過 Grok 4.6 的 36,000 個的兩倍,推高了實際成本。
xAI 推出 Grok 4.7:新增防護機制並提升多小時任務表現

xAI 發布了 Grok 4.7,形容其為迄今最強的程式編寫與知識工作模型。該公司將此模型定位為具競爭力價格的前沿產品,定價與前代 Grok 4.6 相同。

Grok 4.7 建構於全新且更大的基礎模型之上,並透過延伸的強化學習訓練而成,訓練任務組合更為困難,且側重於需要耗時多小時才能完成的問題。據 xAI 表示,這些訓練調整提升了程式碼生成、長上下文處理與自我驗證能力。該模型也原生理解 Grok Bot harness,公司表示這使其在對話任務與一般知識工作上更為有效。

最大幅度的進步集中在耗時較長的程式編寫與終端機任務。在 CursorBench 4.0 上,Grok 4.7 得分 46.3%,Grok 4.6 為 40.4%。其成績超過 GPT-5.6 Sol 的 41.7%,但低於 Fable 5.1 的 51.8%。在 DeepSWE v1.1 高強度模式下,Grok 4.7 得分 71.0%,落後於 GPT-5.6 Sol 的 72.7%,但小幅超過 Fable 5.1 的 70.0%。

該模型在 GDPval 與 AA Briefcase 上的表現也優於 Grok 4.6,後者評估律師、護理師與金融分析師等專業人士完成的多小時辦公室任務。在 AA Briefcase 上,Grok 4.7 得分 1,657,接近 Fable 5.1 的 1,678。最顯著的基準測試進步來自衡量多小時終端機工作的 Terminal-Bench 4.0。Grok 4.7 的得分從 Grok 4.6 的 20.3% 升至 38.0%。

在涵蓋高風險網路任務的 HackerBench v0.3 上,該模型僅放行 3.3% 的危險兩用提示,同時極少攔阻合法的安全工作。

Grok 4.7 is here. It's a notable improvement over Grok 4.6 at the same price and speed. pic.twitter.com/H3OTBbXyvO — SpaceXAI (@SpaceXAI) September 21, 2026

https://x.com/SpaceXAI/status/21020698155586149?ref_src=twsrc%5Etfw

全新安全架構與維持不變的定價

本次發布的核心特色是 Grok 4.7 的安全架構,xAI 稱其為全新設計,且是其測試過在拒答行為與越獄抵抗方面最強的版本。該模型在 LatchBio 的生物安全基準測試中以 62.4% 的得分領先,在網路安全與生物研究等兩用領域中,兼顧良性任務的效能與對危險請求的安全拒答。xAI 也已開始向選定的網路安全合作夥伴提供僅限邀請的存取權,用於防禦研究的紅隊能力。

Grok 4.7 的費率與 Grok 4.6 相同:每百萬輸入 token 2 美元、每百萬輸出 token 6 美元。此費率低於 GPT-5.6 Sol 的 4 美元與 20 美元,以及 Fable 5.1 的 10 美元與 50 美元。輸出速度兩倍的快速版本價格亦為兩倍。單一 token 費率固定使表面價格比較相當直觀,但長時間工作的總成本也取決於模型完成任務所消耗的 token 數量。

在 CursorBench 的性價比前沿上,此定價使 Grok 4.7 成為長時間程式編寫工作負載中較具成本效益的選擇之一。該模型即日起可在 Cursor 與 Grok Build 中使用,也可透過 Grok API、第三方程式編寫 harness、模型路由器與雲端平台存取。

此次發布加劇了前沿模型供應商之間的競爭,他們越來越多地以長時間代理任務、安全校準與每項已完成任務的成本等指標進行比較,而不僅止於基準測試分數。對於評估程式編寫導向模型的開發者與企業而言,Grok 4.7 結合了穩定的定價、更高的多小時任務分數與全新防護機制。

Artificial Analysis 證實進步,但點出 token 消耗問題

獨立基準測試機構 Artificial Analysis 也評估了 Grok 4.7,在 Intelligence Index 上給予 46 分。據該機構表示,此分數比 Grok 4.6 高出兩分,並使 SpaceXAI 晉身四大 AI 實驗室之列。這項外部評估與 xAI 將此次發布定位為程式編寫與知識工作進步的說法一致。

該評估採用 xhigh 推理強度,並發現最明顯的進步在長時程代理知識工作。在 Artificial Analysis 私有的 AA-Briefcase 基準測試上,Grok 4.7 較前代提升 111 個 Elo 分數達到 1,657,與 Claude Opus 5 及 Claude Fable 5.1 並列前沿。此進步主要由分析品質驅動,從 1,690 Elo 大幅升至 1,994 Elo。呈現品質則大致維持穩定。

在衡量文件、試算表與簡報等實際工作成果的 GDPval-AA 上,Grok 4.7 得分 1,695 Elo,增加 90 分。

Grok 4.7 scores 46 on the Artificial Analysis Intelligence Index to bring SpaceXAI the top 4 AI labs. Coding Agent Index performance has also improved, overtaking GPT-5.6 Sol Grok 4.7 scores +2 points over Grok 4.6 on the Intelligence Index, with strong performance on… pic.twitter.com/8p4KC6cgZy — Artificial Analysis (@ArtificialAnlys) September 21, 2026

https://x.com/ArtificialAnlys/status/2102074898327932987?ref_src=twsrc%5Etfw

Artificial Analysis 發現,這些效能進步需要更多的運算資源。在 xhigh 強度下,Grok 4.7 在每項 Intelligence Index 任務中使用了約 81,000 個輸出 token,超過 Grok 4.6 所用 36,000 個的兩倍,並接近 GPT-6 Astra 在最大強度下所消耗 27,000 個的三倍。由於單位 token 費率不變,這種更重的消耗推高了同類任務的實際成本,即使表面定價維持不變。

該機構也回報在 Terminal-Bench 4.0 與 GDP.pdf 上有溫和的額外進步,但在 AA-LCR 與 AutomationBench-AA 上出現小幅退步。可靠性略有改善:AA-Omniscience 幻覺率從 34% 降至 29%,而準確率幾乎維持在 47% 不變。

其他技術規格與前代相同,包括 500,000 token 的上下文視窗。快取命中定價折價至每百萬 token 0.50 美元。隨著模型在 Cursor、Grok Build、Grok API、第三方 harness、模型路由器與雲端平台上線,開發者現在可以根據自身工作負載,權衡基準測試的進步與更高的 token 消耗。原始報導可於 Metaverse Post 查閱。