新闻股票Reflection AI 在十月开放权重发布前开放 Beam 早期访问

Reflection AI 在十月开放权重发布前开放 Beam 早期访问

作者: Cryptopolitan·

要点速览

  • •Reflection AI 于 10 月 5 日开放了其首个开放权重模型 Beam 的早期访问,权重、技术报告和模型卡计划于本月晚些时候在允许商业使用和修改的 Apache 2.0 许可证下发布。
  • •Beam 是一个稀疏混合专家模型,总参数为 5010 亿,每个 token 激活 230 亿参数,Reflection 称其在高级推理测试中与 Z.ai 的 GLM-5.2 相当,同时推理计算量减少 3-4 倍,但这些说法尚未得到验证。
  • •Beam 的强化学习训练运行使用了 10,500 块 Nvidia GB300 GPU,历时四周,产生了超过 1 亿次 rollout,并使用了约 13 亿个沙箱,Reflection 称这是开放实验室中规模最大的 RL 运行之一。
  • •在 Reflection 的基准测试表中,Beam 在四个编码基准上超越了 Thinking Machines Lab 的 Inkling,在 SWE Bench Pro v2-Hard 上得分 77.2,而 Inkling 为 56.9。
  • •Reflection 由前 Google DeepMind 研究员 Misha Laskin 和 Ioannis Antonoglou 于 2024 年创立,已以 250 亿美元投前估值筹集约 47 亿美元,此次开放权重发布将使对 Beam 的独立第三方评估成为可能。
Reflection AI 在十月开放权重发布前开放 Beam 早期访问

根据该公司官方公告,Reflection AI 于 10 月 5 日开放了其首个开放权重模型 Beam 的早期访问。该模型目前正在完成红队测试——这是一种发布前流程,由对抗性测试人员探测模型的安全和安保缺陷——权重、技术报告和模型卡计划于本月晚些时候发布。

据 Reflection 介绍,权重将在 Apache 2.0 许可证下发布,并附带运行、评估和微调该模型所需的全套工具。Apache 2.0 是一种宽松的许可证,允许商业使用、修改和再分发,此次开放权重发布将使开发者能够下载参数并在自己的硬件上运行该模型。

以少 3–4× 的推理计算实现与 GLM-5.2 的对等

Beam 是一个稀疏混合专家模型,总参数为 5010 亿,每个 token 激活 230 亿参数。在此类架构中,每个 token 仅激活模型参数的一部分,从而相对于总参数数量降低了每个 token 所需的计算量。该模型在 23.8 万亿个 token 上进行了预训练,其中期训练期间上下文长度达到 100 万 token。

Reflection 表示,Beam 在高级推理测试中与 Z.ai 的 GLM-5.2 相当,同时使用“少 3–4× 的推理计算”。该公司的说法尚未经过独立验证,但开放发布将使第三方评估成为可能。GLM-5.2 拥有约 7440 亿参数,其中 400 亿为激活参数。Reflection 认为 Kimi K3 在原始能力上领先,并将 Beam 的优势定位为推理效率。

对比 Thinking Machines Lab 于 7 月发布的 Inkling,Reflection 的基准测试表显示 Beam 在四个编码基准上领先,两个模型的分数均已公布。在衡量真实世界软件工程表现的 SWE Bench Pro v2-Hard 上,Beam 得分 77.2,而 Inkling 为 56.9。Inkling 是多模态模型,而 Beam 仅支持文本。

10,500 块 Nvidia GB300 GPU 运行四周完成 RL 训练

Reflection 的强化学习运行使用了 10,500 块 Nvidia GB300 GPU,历时四周,产生了超过 1 亿次 rollout,并使用了约 13 亿个沙箱进行训练和评分。Rollout 是模型对任务的完整尝试,在隔离的沙箱环境中执行和评分。该公司称这是开放实验室中规模最大的 RL 运行之一。据 Reflection 统计,Inkling 使用了 3000 万次 rollout 进行训练。

Reflection 由两位前 Google DeepMind 研究员 Misha Laskin 和 Ioannis Antonoglou 于 2024 年创立。该公司已从包括 Nvidia、红杉资本和光速创业投资基金在内的投资者那里筹集了约 47 亿美元,最近一轮的投前估值为 250 亿美元。

一年前,该公司以 80 亿美元的估值筹集了 20 亿美元,如 Cryptopolitan 报道。其与 SpaceX 的交易金额高达 63 亿美元,即每月 1.5 亿美元用于在孟菲斯附近的 Colossus 2 获取 Nvidia GB300 算力,Cryptopolitan 于 6 月报道。

Beam支撑了 Reflection 的“AI 工厂”服务,该服务允许机构在自己的数据上训练其模型并在自己的算力上运行。新世界集团正在韩国试用主权版本。

“它们有点像火箭飞船,”Laskin 曾这样形容其模型通向前沿的路径。“建造一艘大火箭飞船,需要时间。”