埃隆·马斯克承认 Grok 落后于 Anthropic 的 AI 模型,称 xAI 需要时间追赶
要点速览
- •埃隆·马斯克在 X 上公开承认,xAI 的 Grok 不如 Anthropic 的顶级模型先进,并称 Anthropic 是当前 AI 领域的领导者。
- •Grok 4.5 于 2026 年 7 月 8 日发布,输入 token 定价为每百万 2 美元、输出 token 为每百万 6 美元,在多个基准类别中均落后于 Claude Fable 5 和 Opus 4.8,其中在 DeepSWE 1.1 编码基准上仅得 53%。
- •马斯克将性能差距归因于 xAI 运营仅约三年,而 Anthropic 已有六年时间组建团队并迭代研究。
- •SpaceX 已与 Anthropic 达成一项涉及 xAI Colossus 数据中心设施数百兆瓦电力的大型算力协议,马斯克承诺 AI 基础设施访问保持公平竞争环境。
- •马斯克正在 Tesla 和 SpaceX 内部推广 Grok 的采用,同时允许团队选择表现更佳的替代方案,并预计 xAI 将在 2027 年前达到前沿水平。

埃隆·马斯克在 X 上承认,xAI 的 Grok 不如 Anthropic 最新的 AI 产品先进,他的公司需要时间来追赶——对于一位以极致自信著称的人物来说,这是一次罕见的公开示弱。
这一承认分量十足。马斯克不仅仅是说 Grok 需要改进。他表示,自己对 Anthropic 在 AI 格局中的地位判断完全错误,并称该公司是当前领域的领导者,没有对手能匹敌其顶级模型。对于正在决定基于哪些模型进行开发的开发者和企业来说,这位领域内最知名创始人之一的公开重新评估,是关于前沿目前所处位置的极为直接的数据点。
基准测试揭示差距
Grok 4.5 由 xAI 于 2026 年 7 月 8 日发布,原本被期望是一次竞争力的跃升。该模型定价激进,输入 token 为每百万 2 美元,输出 token 为每百万 6 美元,力图成为该领域重量级产品的高性价比替代方案。每百万 token 的费率是 API 客户为模型使用付费的标准单位,因此定价是相互竞争的产品之间最清晰的比较点之一。
基准测试结果清晰地表明:Grok 4.5 在多个类别中都落后于 Anthropic 的 Claude Fable 5 和 Opus 4.8。这一差距在编码任务中尤为明显——Grok 4.5 在 DeepSWE 1.1 基准上仅得 53%,而编码正是许多客户在选择工程用模型时高度看重的类别。
马斯克对这一差距给出了一个直截了当的解释:xAI 运营仅约三年,而 Anthropic 已有六年时间来组建团队、完善研究流程并迭代模型架构。他的说法将这场竞争归结为研究时间的积累,而非任何单次发布的产品。
与对手的合作
马斯不仅在与 Anthropic 竞争——他还在与该公司合作。SpaceX 已与 Anthropic 达成一项大型算力协议,涉及来自 Colossus 设施(xAI 的大型数据中心基础设施)的数百兆瓦电力。这一安排使两家公司在基准测试中模型正面竞争的同时,也成为商业上的合作方。
马斯克承诺为 AI 基础设施访问保持公平的竞争环境,表明他不会利用自己的硬件优势压制竞争对手。在一个大规模算力获取已成为训练和部署前沿模型决定性因素的市场中,这一承诺意义重大。
Grok 的前进之路
马斯克缩小差距的战略涉及在其企业版图内进行深度整合。他正在 Tesla 和 SpaceX 内部推动 Grok 的采用,将模型应用于各项运营工作流程,同时两家公司的团队在必要时仍可灵活选择更有效的模型。这种灵活性本身就值得关注:内部用户可以转而使用表现更好的竞争对手工具,这给 xAI 带来持续改进的压力。
马斯克表示乐观,认为 xAI 将在 2027 年前达到前沿水平。挑战在于,Anthropic 并未止步不前。其 Opus 5.5 模型——马斯克特别指出优于 Grok——是一个不断移动的目标。随着 2027 年目标的临近,基准测试数据多快能追上这个不断迭代发布新一代模型的对手,是值得关注的焦点。