新聞股票Reflection AI 開放 Beam 搶先體驗,開放權重版本將於10月釋出

Reflection AI 開放 Beam 搶先體驗,開放權重版本將於10月釋出

作者: Cryptopolitan·

重點速覽

  • •Reflection AI 於 10 月 5 日開放其首個開放權重模型 Beam 的搶先體驗,權重、技術報告與模型卡將於本月稍晚以允許商業使用與修改的 Apache 2.0 授權釋出。
  • •Beam 是一個總參數量 5,010 億、每 token 啟用 230 億參數的稀疏混合專家模型,Reflection 表示其在高階推理測試中媲美 Z.ai 的 GLM-5.2,同時推理運算量減少 3 至 4 倍,但這些說法尚未經驗證。
  • •Beam 的強化學習訓練使用了 10,500 塊 Nvidia GB300 GPU 歷時四週,產生超過 1 億次 rollout,並使用約 13 億個沙盒,Reflection 稱之為開放實驗室中規模最大的強化學習訓練之一。
  • •在 Reflection 的基準測試表格中,Beam 在四項編碼基準上超越 Thinking Machines Lab 的 Inkling,在 SWE Bench Pro v2-Hard 上得分 77.2 對 Inkling 的 56.9。
  • •Reflection 由前 Google DeepMind 研究員 Misha Laskin 與 Ioannis Antonoglou 於 2024 年創立,已募集約 47 億美元,投前估值 250 億美元,開放權重釋出將使對 Beam 的獨立第三方評測成為可能。
Reflection AI 開放 Beam 搶先體驗,開放權重版本將於10月釋出

根據該公司的官方公告,Reflection AI 於 10 月 5 日開放其首個開放權重模型 Beam 的搶先體驗。該模型目前正在完成紅隊測試——這是一種在發布前由對抗性測試人員探測模型安全與資安缺陷的流程——權重、技術報告與模型卡預計於本月稍晚釋出。

據 Reflection 表示,權重將以 Apache 2.0 授權釋出,並附帶執行、評估與微調該模型所需的完整技術堆疊。Apache 2.0 是一種寬鬆的授權,允許商業使用、修改與再散布,開放權重的釋出將讓開發者能夠下載參數並在自己的硬體上執行該模型。

以減少 3–4 倍推理運算量達到 GLM-5.2 同等水準

Beam 是一個稀疏混合專家模型,總參數量為 5,010 億,每個 token 啟用 230 億參數。在這類架構中,每個 token 僅啟用模型參數的一部分,相較於總參數量可降低每個 token 所需的運算量。該模型以 23.8 兆 token 進行預訓練,並在中期訓練期間將上下文長度達到 100 萬 token。

Reflection 表示,Beam 在高階推理測試中媲美 Z.ai 的 GLM-5.2,同時使用「減少 3–4 倍的推理運算量」。該公司的說法尚未經獨立驗證,但開放釋出將使第三方評測成為可能。GLM-5.2 擁有約 7,440 億參數,其中 400 億為啟用參數。Reflection 認為 Kimi K3 在原始能力上領先 Beam,並將 Beam 的優勢定位為推理效率。

對照 Thinking Machines Lab 7 月發布的 Inkling,Reflection 的基準測試表格顯示 Beam 在四項編碼基準上領先,並公布了兩個模型的分數。在衡量實際軟體工程表現的 SWE Bench Pro v2-Hard 基準上,Beam 得分 77.2,Inkling 為 56.9。Inkling 是多模態模型,而 Beam 僅支援文字。

10,500 塊 Nvidia GB300 GPU 執行四週強化學習

Reflection 的強化學習訓練使用了 10,500 塊 Nvidia GB300 GPU,歷時四週,產生超過 1 億次 rollout,並使用了約 13 億個沙盒進行訓練與評分。Rollout 是模型對任務的完整嘗試,在隔離的沙盒環境中執行並評分。該公司稱這是開放實驗室中規模最大的強化學習訓練之一。依 Reflection 的統計,Inkling 以 3,000 萬次 rollout 進行訓練。

Reflection 由兩位前 Google DeepMind 研究員 Misha Laskin 與 Ioannis Antonoglou 於 2024 年創立。該公司已自 Nvidia、紅杉資本與光速創投等投資者處募集約 47 億美元,最近一輪融資的投前估值為 250 億美元。

一年前,該公司以 80 億美元估值募集了 20 億美元,如Cryptopolitan 所報導。其 SpaceX 交易金額最高達 63 億美元,即每月 1.5 億美元購買孟菲斯附近 Colossus 2 的 Nvidia GB300 容量,Cryptopolitan 於 6 月報導。

Beam 也支撐 Reflection 的「AI 工廠」服務,讓機構能在自己的資料上訓練其模型並在自己的運算資源上執行。新世界集團正在南韓試行主權版本。

「它們有點像火箭,」Laskin 曾這樣形容其模型邁向前沿的路程。「要打造一枚大型火箭,需要時間。」