新聞股票馬斯克承認Grok落後於Anthropic的AI模型,稱xAI需要時間追趕

馬斯克承認Grok落後於Anthropic的AI模型,稱xAI需要時間追趕

作者: CryptoBriefing·

重點速覽

  • •馬斯克在X上公開承認xAI的Grok不如Anthropic的頂尖模型,並稱Anthropic是目前AI領域的領先者。
  • •於2026年7月8日推出、定價為每百萬輸入代幣2美元與每百萬輸出代幣6美元的Grok 4.5,在多項基準測試類別中落後於Claude Fable 5與Opus 4.8,其中在DeepSWE 1.1編碼基準測試中僅得53%。
  • •馬斯克將效能差距歸因於xAI僅運作約三年,而Anthropic已有六年時間建立團隊並迭代研究。
  • •SpaceX已與Anthropic達成一項涉及xAI Colossus數據中心設施數百兆瓦電力的重大運算協議,馬斯克並承諾維持AI基礎設施存取的公平競爭環境。
  • •馬斯克正在Tesla與SpaceX內部推動Grok的採用,同時允許團隊選擇表現更佳的替代方案,並預期xAI將在2027年前達到前沿水準的表現。
馬斯克承認Grok落後於Anthropic的AI模型,稱xAI需要時間追趕

馬斯克在X上承認,xAI的Grok不如Anthropic最新的AI產品,其公司需要時間追趕——對一位以極高自信著稱的人物而言,這是罕見的公開示弱。

這番承認具有實質分量。馬斯克不僅表示Grok需要改進,他還承認自己對Anthropic在AI領域的地位判斷完全錯誤,稱該公司是目前業界領先者,沒有對手能匹敵其頂尖模型。對於正在決定要建構於哪些模型之上的開發者與企業而言,來自業界最知名創辦人之一的公開重新評估,是關於當前前沿所處位置的異常直接的參考指標。

基準測試顯示差距

xAI於2026年7月8日推出的Grok 4.5原本被期望是一次競爭力的大躍進。該模型定價積極,每百萬輸入代幣2美元、每百萬輸出代幣6美元,定位為業界重量級產品的低成本替代方案。每百萬代幣費率是API客戶支付模型使用費的標準單位,因此定價是比較各家產品最清晰的指標之一。

基準測試結果描繪出清晰的圖像:Grok 4.5在多個類別中均落後於Anthropic的Claude Fable 5與Opus 4.8。這一差距在編碼任務中尤其明顯——Grok 4.5在DeepSWE 1.1基準測試中僅得53%——而編碼正是許多客戶在為工程工作選擇模型時高度重視的類別。

馬斯克為這一差距提出了一個直接的解釋:xAI僅運作約三年,而Anthropic已有六年時間來建立團隊、完善研究流程並迭代模型架構。他的說法將這場競爭定位為累積研究時間之爭,而非任何單一版本的布。

與對手的夥伴關係

馬斯克不僅與Anthropic競爭——他也與該公司合作。SpaceX已與Anthropic達成重大運算協議,涉及來自xAI龐大數據中心基礎設施Colossus設施的數百兆瓦電力。這項安排使兩家公司成為商業夥伴,即使其模型在基準測試中正面競爭。

馬斯克承諾維持AI基礎設施存取的公平競爭環境,表明他不會利用硬體優勢來遏制競爭對手。在一個大規模運算資源的取得已成為訓練與部署前沿模型決定性因素的市場中,這一承諾具有重要意義。

Grok的前進之路

馬斯克縮小差距的策略涉及在其企業帝國內部深度整合。他在Tesla與SpaceX兩家公司內部推動Grok的採用,將模型應用於營運流程,同時兩家公司的團隊在必要時仍保有選擇更有效模型的彈性。這種彈性本身就值得注意:內部使用者若發現對手的工具表現更好,便可改用,持續對xAI形成改進壓力。

馬斯克表達了樂觀態度,認為xAI將在2027年前達到前沿水準的表現。挑戰在於Anthropic並未停滯不前。其Opus 5.5模型——馬斯克明確指出優於Grok——是一個移動的目標。隨著2027年目標臨近,基準測試數據能否以及多快追上面對持續推出新一代模型之對手,是值得關注的焦點。