Ox Alpha 免费上线,宣称击败 Claude Fable 5 和 GPT-5.6 Sol,但缔造者身份成谜
要点速览
- •Ox Alpha 于 8 月 20 日作为免费隐形模型在 OpenRouter、OpenCode、Cline 和 Nous Research 的 portal+ 上线。
- •一项 10 项任务的小规模 DeepSWE 抽样最初显示 Ox Alpha 击败了 Claude Fable 5 和 GPT-5.6 Sol,但随后完整的 113 项任务测试将其成绩定在 63% 左右。
- •该模型支持文本、图像和视频输入,拥有约 100 万 token 的上下文窗口,并提供工具和函数调用,但 JSON 输出不强制执行 schema。
- •关于模型缔造者的猜测涉及 Google、小米、DeepSeek 和微软的 MAI,但最有力的证据指向智谱 AI 的 GLM-5.3 系列。
- •Stripe 首席执行官 Patrick Collison 公开称赞 Ox Alpha 非常令人印象深刻,这有助于扩大对该模型的关注。

免费的“隐形模型”Ox Alpha 于 8 月 20 日在 OpenRouter、OpenCode、Cline 以及 Nous Research 的 portal+ 上线。
一项疯传的说法称 Ox Alpha 在 DeepSWE 上击败了 Anthropic 的 Claude Fable 5 和 OpenAI 的 GPT-5.6 Sol,但这仅来自一个 10 项任务的样本。随后两次独立的完整 113 项任务测试成绩约为 63%,与 GPT-5.6 Sol 大致持平。
Google、小米、DeepSeek 和微软的 MAI 都曾被提及是该模型的可能缔造者。但最主流的理论指向智谱 AI 的 GLM-5.3 系列。
AI 爱好者正密切关注一款名为 Ox Alpha 的 AI 模型,该模型于 8 月 20 日出现在 OpenRouter 上,未附带任何公司名称。模型页面将其描述为“专为编程、持续智能体工作和生产级工作负载而设计的推理模型”,由一家在预览期间选择保持匿名的第三方提供商打造。
这款神秘模型之所以受到关注,还因为它似乎在编程基准测试中超越了 Anthropic 的 Claude Fable 5 和 OpenAI 的 GPT-5.6 Sol——这一说法之所以重要,是因为开发者正越来越多地利用这些测试来比较那些他们可能尚无法识别来源的模型。
DeepSWE 是一项基准测试,衡量编程智能体首次尝试即正确解决真实 GitHub 问题的频率,以从 91 个代码仓库中抽取的 113 项任务的通过百分比表示。在该基准上,Ox Alpha 已被证明可与顶级模型一较高下。
开发者 Ben Davis 首先在一个 10 项任务的样本上运行了 Ox Alpha,并报告首轮通过率为 80%,领先于 65% 的 Claude Fable 5 和 52% 的 GPT-5.6 Sol。这一结果迅速传播,其各种版本持续流传,仿佛 Ox Alpha 对这两款模型均有明显优势,尽管小样本仍留有误差空间。
I ran this thing through 10 tasks on DeepSWE (so there could be a ton of variance in it's real score, this is a subset), but uh... gpt-5.6-sol: 52% fable: 65% whatever the hell this is: 80% (was a near miss on the "x"s so actually over 80%) I am very confused pic.twitter.com/NdDSTjoHLj — Ben Davis (@davis7) August 21, 2026
截至 8 月 22 日,Ox Alpha 在 Artificial Analysis 或 Arena 上仍无收录条目,这让试图将其与其他前沿模型进行比较的用户可参考的公开基准更少。
该模型免费使用,单个上下文窗口最多可读取约 100 万个 token,接受文本、图像和视频输入并返回文本。它还支持工具和函数调用,但其 JSON 输出不强制执行 schema,这对构建需要结构化响应的智能体的开发者而言可能是一项局限。
OpenCode 表示其路由每天可处理 100 万亿(100 trillion)个 token,而通过自家门户免费提供该模型的 Nous Research 则宣称容量达 1000 万亿(1 quadrillion)。Token 是 AI 模型处理信息的基本单位,如此量级的吞吐量使该系统跻身当今市场上使用最广泛、能力最强的模型行列。
Ox Alpha (stealth model) is free for the next week - 1M Context - Multi-modal - Zero Data Retention Generous rate limits, near unlimited usage We have capacity for 100T tokens per day, lets see what you can do — OpenCode (@opencode) August 20, 2026
为什么所有人都关注它
Stripe 首席执行官 Patrick Collison(其公司已于 8 月 19 日同意收购 OpenRouter)在 X 上的一则帖子中称 Ox Alpha“非常令人印象深刻”。这位知名科技高管的这一评价在模型上线数小时内就将其推入了更广泛的讨论,尤其是因为在制造商身份公开之前,该模型已通过多个接入渠道开始流传。
$ ori --model stealth/ox-alpha
It's very impressive. — Patrick Collison (@patrickc) August 21, 2026
目前尚无人公开认领该模型。AI 分析师 Andrew Curran 周五发帖称,对于 Ox Alpha 的出处,人们“似乎对一切都更不确定了”。
随着关注升温,猜测迅速扩散。开发者们提出了微软尚未发布的 MAI 系列、小米的 MiMo 产品线、DeepSeek、阿里巴巴的 Qwen,甚至 Google 的 Gemini。认同 Gemini 的人如此之多,以至于有开发者调侃称 Google 正在把竞争对手的隐形模型当作自家产品的营销手段。
但这些猜测大多经不起证据检验。小米的 MiMo v2.5 接受音频输入,而 Ox Alpha 明确拒绝这一主打特性。DeepSeek 从未推出视频能力,并且发布开放权重而非采用隐形预览。Google 和 Qwen 使用的分词器和视频编码器完全不同,因此难以支持它们与该模型的直接关联。
剩余证据最有力地指向智谱 AI 的模型。独立指纹识别在每一项标准化测试中都将 Ox Alpha 的分词器与 GLM-5.3 匹配,并在四段独立视频片段中将其视频 token 消耗与 GLM-5V-Turbo 完全匹配。它还同样表现出 GLM 特有的错误模式以及拒绝音频输入的行为。
Ox Alpha's tokenizer is one for one identical to GLM's. No other lab's tokenizer gets past 4/11 when it comes to tokenizer similarity. (h/t: @sushsrinivasan ) (3/n) pic.twitter.com/dNwwZmCYZ7 — Ananay (@ananayarora) August 21, 2026
然而,一个细节让完美匹配变得复杂。GLM-5.3 于 8 月 14 日作为纯文本模型发布,比支持完整视频功能的 Ox Alpha 早六天问世。如果指纹识别结论成立,Ox Alpha 更可能是该系列的一个未发布多模态升级版,而非直接复制品,一些分析师已开始将这种可能性称为 GLM-5.3 Flash。
智谱 AI 尚未就 Ox Alpha 发表任何公开评论。
究竟什么是隐形模型
隐形模型是指通过 OpenRouter 等路由平台匿名发布、不注明出处的前沿级 AI 系统。这种安排让实验室在正式公开发布之前就能收集真实世界的使用数据。
这种模式已在中国实验室中变得常见。智谱 AI 的 Pony Alpha 于 2 月在五天内被证实为 GLM-5。小米的 Hunter Alpha 于 3 月被证实为 MiMo-V2-Pro。美团的 Owl Alpha 匿名运行了两个月,随后于 6 月被确认为 LongCat-2.0。
Ox Alpha 目前已在 OpenRouter 上线,模型 ID 为 stealth/ox-alpha,同时也可通过 OpenCode、Cline 和 Nous Portal 访问,全部免费查询。OpenCode 表示,免费期自 8 月 20 日上线起约持续一周,预计截止时间在 8 月 27 日前后。届时,如果此前匿名模型呈现的规律延续,提供商或许终将揭晓其名称。