Reflection AI 發表 Beam:5,020 億參數的開放權重模型,預計本月稍晚推出
重點速覽
- •Reflection AI 發表了 Beam,一款總參數量達 5,020 億的開放權重模型,完整權重與技術文件預計於 2026 年 10 月稍晚以 Apache 2.0 授權釋出。
- •該模型採用稀疏混合專家(Mixture-of-Experts)架構,每個 token 僅有 230 億個參數處於活躍狀態,該公司表示此設計可降低運行成本。
- •Reflection 宣稱 在 SWE-Bench Verified 上取得 80.9 分、Terminal Bench v2.1 上取得 80.1 分,達到或接近 Z.ai 的 GLM-5.2 與阿里巴巴的 Qwen 3.8-Max,且推論運算用量減少 3 至 4 倍。
- •這些基準測試結果為自行報告,獨立測試將在權重公開釋出後才會展開。
- •Reflection AI 於 2024 年 3 月由前 Google DeepMind 研究人員創立,已募集超過 40 億美元,投前估值為 250 億美元,投資者包括 Nvidia、Sequoia 與 Citigroup,並與五角大廈及美國能源部建立合作夥伴關係。

Reflection AI 發表了 Beam,一款總參數量達 5,020 億的開放權重人工智慧模型,完整版本預計於本月稍晚推出。
該公司於 2026 年 10 月 5 日宣布此模型,並將 Beam 定位為中國開放模型的西方答案——這些中國模型已悄然佔據開發者工作負載的相當大比重。此類開放權重釋出使模型的訓練參數可供下載,企業可以檢視、調整並在自己的基礎設施上運行,而不必完全依賴供應商的託管服務。
為效率而生的稀疏架構
Beam 採用技術上所稱的稀疏混合專家(Mixture-of-Experts)架構。雖然它總共擁有 5,020 億個參數,但每個 token——即文字的基本單位,約相當於一個單詞或單詞的一部分——僅有 230 億個參數處於活躍狀態。這一區別至關重要,因為決定模型運行成本的是活躍參數,而非總參數量。一個在任何時刻僅動用自身一小部分的超大模型,可以保持強大能力,而不必在每次回覆時耗費大量資金。
Reflection 表示,Beam 以 23.8 兆個 token 進行預訓練,隨後經歷大規模強化學習——模型在此過程中練習任務並因良好答案獲得獎勵。該公司在 10,500 塊 NVIDIA GB300 GPU 上執行了超過 1 億次此類練習 rollout。
基準測試訴求
Reflection 將 Beam 與兩個特定的中國競對手比較:Z.ai 的 GLM-5.2 與阿里巴巴的 Qwen 3.8-Max。根據該公司的說法,Beam 在性能上達到或接近這些模型,尤其是在推理與程式編寫方面。
Beam 在測試模型能否修復真實軟體錯誤的 SWE-Bench Verified 上取得 80.9 分,在衡量模型在命令列環境中運作能力的 Terminal Bench v2.1 上取得 80.1 分。Reflection 表示,Beam 在推論運算用量減少 3 至 4 倍的情況下達到了這一競爭水準。
這些基準測試結果目前為自行報告,技術報告尚未發表。獨立測試將在權重釋出後展開。
完整模型權重與技術文件預計於 2026 年 10 月稍晚以 Apache 2.0 授權釋出——這是目前最寬鬆的開源授權之一,通常允許企業在幾乎沒有限制的情況下使用、修改及商業化該軟體。
幕後推手
Reflection AI 是一家美國新創公司,於 2024 年 3 月由前 Google DeepMind 研究人員創立。該公司自成立以來已募集超過 40 億美元,最新一輪融資將其投前估值定為 250 億美元。投資者包括 Nvidia、Sequoia(紅杉資本)與 Citigroup(花旗集團)。
該公司也在華盛頓建立了關係。其合作夥伴關係包括與五角大廈及美國能源部的合作,Reflection 表示其重心正轉向為企業客戶量身打造的可擴展 AI。
為何中國因素至關重要
開放模型市場存在地理問題,至少從美國視角來看是如此。據報導,中國開放模型近期已取得超過 30% 的 token 份額,而 Reflection 則押注市場對本土替代方案存在真實需求。Token 份額追蹤透過不同模型處理的文字量,是衡量實際使用情況的粗略指標。其宣示的目標是為西方使用者提供不依賴中國供應商的強大開放權重選項。
對政府機構與受監管產業而言,模型的來源可能與其性能同樣重要。Reflection 與五角大廈及能源部的合作顯示,它正大力強調這一論點。
這代表什麼
對企業買家而言,效率宣稱是值得關注的重點。如果 Beam 真的能在推論運算用量減少 3 至 4 倍的情況下提供相當的推理與程式編寫性能,這將改變自架部署的成本計算——在自架部署中,推論成本隨每次查詢重複產生,並與使用量直接成正比。
風險也很明確。自行報告的基準測試長期以來在發布公告中的表現往往優於實際環境,而程式編寫分數尤其容易受到測試執行方式的影響。值得關注的關鍵日期是 2026 年 10 月稍晚計劃的權重釋出與技術報告。