馬斯克的SpaceXAI推出Grok 4.7,DeepSWE基準測試得分71%
重點速覽
- •SpaceXAI於9月21日發布Grok 4.7,稱其為迄今在程式編寫與知識工作方面最強的模型,訓練聚焦於需時數小時的任務。
- •該模型以每百萬輸入token 2美元、每百萬輸出token 6美元的價格推出,與Grok 4.6相同,遠低於GPT-5.6 Sol的4美元/20美元與Fable 5.1的10美元/50美元。
- •根據SpaceXAI公布的基準測試,Grok 4.7在DeepSWE v1.1取得71.0%,將Terminal-Bench 4.0從前代的20.3%提升至38.0%,並在EEBench與Harvey法律代理基準上領先,但在CursorBench 4.0與HealthBench Professional上落後於Fable 5.1。
- •重建的安全架構在HackerBench v0.3中擋下除3.3%以外的所有高風險兩用提示,誤拒極少,特定網路安全合作夥伴獲得僅限邀請的紅隊存取權。
- •發布前數小時,Grok 4.6的三個配置在Ben Swerdlow的Brood War Bench中敗給每一個Codex與Claude配置,最佳成績為18場中勝2場,而Grok 4.7尚未被排名。

Grok 4.7瞄準需時數小時的工作負載
馬斯克(Elon Musk)旗下AI部門SpaceXAI於9月21日發布Grok 4.7,稱其為公司迄今在程式編寫與知識工作方面最強的模型。根據官方公告,新系統建構於比Grok 4.6更大的基礎模型之上,並在更艱難的任務組合上經歷了更長時間的強化學習週期,特意聚焦於需要數小時才能完成的問題。
公司將此次發布定位於「持久力」。在早期模型以分鐘計回答問題之處,Grok 4.7被調校為能夠持續處理一般人類工程師或分析師需耗時數小時的任務。SpaceXAI表示,該模型在長時間運行中驗證自身輸出、處理極長上下文窗口(即模型一次能保持在工作中視野內的文字量),以及原生操作Grok Bot代理框架方面均有顯著提升——這是一種多步驟設置,模型會自行規劃、呼叫工具並執行工作,而非僅回答單一提示——公司稱這些升級在對話、通用知識任務以及專業文件與簡報的生成中均可見。
在公布的基準測試中,xhigh配置已接近前沿水準。在軟體工程測試套件DeepSWE v1.1上,Grok 4.7取得71.0%,略勝於Fable 5.1 max的70.0%,僅落後於GPT-5.6 Sol max的727%。在評分需時數小時終端機工作的Terminal-Bench 4.0上,該模型從前代的20.3%躍升至38.0%。在模擬律師、護理師與金融分析師需時數小時專業工作的測試套件——包括AA Briefcase與HealthBench——SpaceXAI表示Grok 4.7現已與業界最佳水準持平。
安全是另一項主打聲明。重建的安全架構使其成為公司在拒絕不當請求與抵禦越獄(即試說服模型繞過其防護機制)方面迄今最嚴格的版本。在測試惡意網路任務的HackerBench v0.3中,僅3.3%的高風險兩用提示(即同時具備正當與有害用途的請求)成功通過,且對正當防禦性安全工作的誤拒極少。公司並向特定的網路安全合作夥伴提供僅限邀請的紅隊存取權——即安全研究人員探測系統弱點的對抗性測試——以支援防禦研究。
該模型現已透過Cursor、Grok Build、Grok API、主要雲端平台與模型路由器(即透過單一介面將開發者請求轉交給其選定AI模型的服務)上線。
定價維持2美元之際,《Brood War》基準測試令Grok 4.6難堪
定價是安靜的常數:Grok 4.7以每百萬輸入token 2美元、每百萬輸出token 6美元的價格推出——與Grok 4.6完全相同——另有輸出速度加倍、價格亦加倍的高速版本。Token是語言模型讀取與生成的文字單位,API計費即以token計量:輸入涵蓋開發者發送的內容,輸出則為模型寫回的內容。此費率大幅低於競爭對手:GPT-5.6 Sol定價為每百萬token 4美元/20美元,Fable 5.1為10美元/50美元,使Grok的定價約為對手水準的三分之一至一半,且交付速度更快。
SpaceXAI自身的比較表顯示,Grok 4.7在電機工程(EEBench:64.0%,對GPT-5.6 Sol的39.4%與Fable 5.1的56.4%)以及Harvey法律代理基準測試(19.6%,對2.5%與6.7%)上領先,而在軟體工程(CursorBench 4.0:46.3%,對51.8%)與臨床推理(HealthBench Professional:56.7%,對62.1%)上落後於Fable 5.1。以上所有數據均來自SpaceXAI公布的資料。
公司背景亦不容忽視:SpaceXAI於2月成形,當時xAI併入SpaceX,隨後於6月收購Cursor——這款同時也是Grok 4.7發布管道之一的AI程式碼編輯器——屬於橫跨Tesla(TSLA)的馬斯克商業帝國的一部分,且據先前報導,馬斯克正推動在數週內整合AI訂閱方案。
不過,就在發布前數小時,一項眾包基準測試令前代模型受挫。開發者Ben Swerdlow的Brood War Bench——AI代理在其中對戰《星海爭霸:怒火燎原》——於9月20日在X上流傳:來自Codex、Claude與Grok的19個配置進行了171場對抗賽,Codex Astra在最高推理設定下橫掃其全部18場比賽。Grok 4.6的三個配置則敗給每一個Codex與Claude配置,最佳成績為18場中僅勝2場。即時戰略對代理而言是一項高難度考驗,因為經濟、生產與戰鬥決策持續不斷地湧現——沒有任何回合可以停下來思考。
Swerdlow記錄了一場比賽,其中最高推理設定的Grok在43分鐘內燒掉11,138個推理token,卻只發出六批次指令——從未生產出任何一個作戰單位。他寫道,Grok在這款遊戲上還不夠聰明,較舊的模型把即時戰略當成回合制來處理,並補充沒有任何參賽者超越新手水準。Grok 4.7尚未被列入排名。
COINOTAG解讀:定價壓力才是真正的信號
綜合來看,發布當日的數據與《Brood War》的慘況講述的是同一個故事:前沿實驗室現正以商品價格出售推理能力,而代理可靠性——而非靜態基準分數——才決定誰能勝出。COINOTAG的評估是:2美元/6美元的定價賦予Grok 4.7競爭對手必須跟進的token經濟學,正如期貨定價迫使市場重新錨定預期一樣;而缺乏同等算力的實驗室則可能在這場價格戰中淪為「退出流動性」。該媒體補充,馬斯克的算力新聞歷來會帶動狗狗幣(DOGE)等與馬斯克相關資產的市場情緒,並建議關注Grok 4.7的代理實際表現,而非其發布宣稱。