Ox Alpha 免費開放,傳出勝過 Claude Fable 5 與 GPT-5.6 Sol,但其開發者仍成謎
重點速覽
- •Ox Alpha 於 8 月 20 日作為免費 stealth model 在 OpenRouter、OpenCode、Cline 與 Nous Research 的 portal+ 上線。
- •一個較小的 10 題 DeepSWE 樣本最初顯示 Ox Alpha 勝過 Claude Fable 5 與 GPT-5.6 Sol,但之後完整的 113 題測試將其成績拉回到約 63%。
- •該模型支援文字、圖片與影片輸入,具備約 100 萬 tokens 的 context window,並支援 tool 與 function calling,但 JSON 輸出不受 schema 強制約束。
- •對其開發者的猜測包括 Google、Xiaomi、DeepSeek 與 Microsoft 的 MAI,但最強證據指向智譜 AI 的 GLM-5.3 家族。
- •Stripe 執行長 Patrick Collison 公開稱 Ox Alpha very impressive,進一步擴大了外界關注。

Ox Alpha 這個免費的「stealth model」於 8 月 20 日在 OpenRouter、OpenCode、Cline 與 Nous Research 的 portal+ 上線。
一項病毒式傳播的說法稱,Ox Alpha 在 DeepSWE 上勝過 Anthropic 的 Claude Fable 5 與 OpenAI 的 GPT-5.6 Sol;這一說法來自一組 10 題樣本。之後兩次完整的 113 題測試結果都落在約 63%,大致與 GPT-5.6 Sol 持平。
Google、Xiaomi、DeepSeek 與 Microsoft 的 MAI 都曾被提名為這個模型的可能開發者,但最強的推測則指向智譜 AI 的 GLM-5.3 家族。
AI 愛好者正高度關注名為 Ox Alpha 的 AI 模型,它於 8 月 20 日出現在 OpenRouter 上,且未附帶任何公司名稱。該列表將其描述為「一個專為編碼、持續的 agentic 工作與 production workloads 設計的推理模型」,由第三方供應商打造,並在預覽期間選擇保持匿名。
這款神祕模型同時也因在編碼基準測試上似乎優於 Anthropic 的 Claude Fable 5 與 OpenAI 的 GPT-5.6 Sol 而受到注意;這項說法之所以重要,是因為開發者愈來愈常用這些測試來比較尚未能確認身分的模型。
DeepSWE 是一項基準測試,用來衡量編碼代理首次正確解決真實 GitHub issue 的頻率,以 113 個取自 91 個儲存庫的任務中通過的百分比表示。在這項基準上,Ox Alpha 已展現出與頂尖模型競爭的能力。
開發者 Ben Davis 先以 10 題樣本測試 Ox Alpha,並回報其首次通過得分為 80%,領先 Claude Fable 5 的 65% 與 GPT-5.6 Sol 的 52%。該結果迅速擴散,而其後續版本仍持續流傳,彷彿 Ox Alpha 已明顯領先這兩個模型,即使小樣本仍保留相當大的變異空間。
我用 DeepSWE 跑了這個東西的 10 個任務(所以它真實分數可能會有很大變異,這只是子集),但呃…… gpt-5.6-sol: 52% fable: 65% whatever the hell this is: 80%(因為 x 的數量差一點點,所以其實超過 80%)我非常困惑 pic.twitter.com/NdDSTjoHLj — Ben Davis (@davis7) August 21, 2026
截至 8 月 22 日,Ox Alpha 仍未出現在 Artificial Analysis 或 Arena 上,讓使用者在與其他前沿模型比較時可參考的公開資料更少。
這個模型可免費使用,在單一 context window 中最多可讀取約 100 萬 tokens,並接受文字、圖片與影片輸入,同時輸出文字。它也支援 tool 與 function calling,不過其 JSON 輸出並未強制遵循 schema,這對需要結構化回應的代理開發者來說是一個明顯缺口。
OpenCode 表示其路由每天可處理 100 trillion tokens;而透過自家 portal 免費提供該模型的 Nous Research 則宣稱容量可達 1 quadrillion。Tokens 是模型可處理資訊的基本單位,而這樣的吞吐量使它與當今市場上最常用、最強大的模型處於同一級別。
這些數字很容易讓人得出結論:該模型表現優異,因此預期會有大量使用,而供應方也有足夠的基礎設施支撐負載。
Ox Alpha (stealth model) is free for the next week - 1M Context - Multi-modal - Zero Data Retention Generous rate limits, near unlimited usage We have capacity for 100T tokens per day, lets see what you can do — OpenCode (@opencode) August 20, 2026
Ox Alpha(stealth model)接下來一週免費
- 1M Context - Multi-modal - Zero Data Retention
寬鬆的 rate limits,近乎無限制使用
我們每天有 100T tokens 的容量,看看你能做些什麼
— OpenCode (@opencode) August 20, 2026
為什麼大家都在關注
Stripe 執行長 Patrick Collison 的公司已於 8 月 19 日同意收購 OpenRouter,他在 X 上發文稱 Ox Alpha「very impressive」。這位知名科技高層的這一句話,在上線數小時內就幫助這個模型進入更廣泛的討論。
$ ori --model stealth/ox-alpha It's very impressive. — Patrick Collison (@patrickc) August 21, 2026
$ ori --model stealth/ox-alpha
It's very impressive.
— Patrick Collison (@patrickc) August 21, 2026
目前尚無人公開承認這個模型。AI 分析師 Andrew Curran 在週五發文稱,人們對於 Ox Alpha 的來源「seem less sure of anything」。
隨著關注升高,猜測迅速擴大。開發者提出 Microsoft 尚未發布的 MAI 系列、Xiaomi 的 MiMo 線、DeepSeek、Alibaba 的 Qwen,甚至 Google 的 Gemini。支持 Gemini 的人多到一位開發者開玩笑說,Google 正把競爭對手的 stealth model 當作自家行銷素材。
大多數這些推測都無法與證據相符。Xiaomi 的 MiMo v2.5 接受音訊輸入,而這正是 Ox Alpha 明確拒絕的功能。DeepSeek 從未推出影片能力,而且發布的是 open weights,而非 stealth previews。Google 與 Qwen 則使用完全不同的 tokenizer 與 video encoder,因此很難與這些模型建立穩固聯繫。
剩下的證據最強烈地指向智譜 AI 的模型家族。獨立指紋比對顯示,Ox Alpha 的 tokenizer 在所有標準化測試中都與 GLM-5.3 相符,而其 video-token 消耗在四段不同影片中也與 GLM-5V-Turbo 完全一致,並且共享 GLM 典型的錯誤與拒絕音訊輸入的行為。
Ox Alpha 的 tokenizer 與 GLM 的完全一樣。就 tokenizer 相似度而言,沒有其他實驗室的 tokenizer 能超過 4/11。 @sushsrinivasan)(3/n)pic.twitter.com/dNwwZmCYZ7 — Ananay (@ananayarora) August 21, 2026
Ox Alpha 的 tokenizer 與 GLM 的完全一樣。就 tokenizer 相似度而言,沒有其他實驗室的 tokenizer 能超過 4/11。 @sushsrinivasan)
(3/n) pic.twitter.com/dNwwZmCYZ7
— Ananay (@ananayarora) August 21, 2026
不過,有一個細節讓完全吻合變得複雜。GLM-5.3 於 8 月 14 日以純文字模型形式上線,早於 6 天前 Ox Alpha 以完整影片支援現身。如果這項指紋比對成立,Ox Alpha 更可能是該系列尚未發布的多模態升級版,而非一個完全相同的複製品;分析人士已開始將這種可能性稱為 GLM-5.3 Flash。
Zhipu AI 對 Ox Alpha 迄今尚未公開表態。
什麼是 stealth model?
stealth model 是一種前沿級 AI 系統,透過像 OpenRouter 這樣的 routing platform 以未署名方式發布,讓實驗室在正式對外發布前先收集真實世界的使用資料。
這種模式在中國實驗室中已相當常見。Zhipu AI 自家的 Pony Alpha 在 2 月內五天之內就被揭露為 GLM-5,Xiaomi 的 Hunter Alpha 在 3 月被證實是 MiMo-V2-Pro,而 Meituan 則讓 Owl Alpha 匿名運行兩個月,直到 6 月才確認其為 LongCat-2.0。
Ox Alpha 目前已在 OpenRouter 上以模型 ID stealth/ox-alpha 上線,並可透過 OpenCode、Cline 與 Nous Portal 使用,且都可免費查詢。OpenCode 的上線說明將免費期定為自 8 月 20 日首次亮相起約一週,推算可能的截止時間約為 8 月 27 日——之後若延續過去四個匿名模型的模式,或許終於會有人為它命名。