新闻股票Reflection AI 发布 5010 亿参数开源权重模型 Beam,将于本月晚些时候正式推出

Reflection AI 发布 5010 亿参数开源权重模型 Beam,将于本月晚些时候正式推出

作者: CryptoBriefing·

要点速览

  • •Reflection AI 发布了总参数量达 5010 亿的开源权重模型 Beam,完整权重和技术文档计划于 2026 年 10 月晚些时候以 Apache 2.0 许可证发布。
  • •该模型采用稀疏混合专家架构,每个 token 仅激活 230 亿参数,该公司称这一设计可降低运行成本。
  • •Reflection 声称 Beam 在 SWE-Bench Verified 上得分 80.9,在 Terminal Bench v2.1 上得分 80.1,达到或接近 Z.ai 的 GLM-5.2 和阿里巴巴的 Qwen 3.8-Max 的水平,同时推理计算量减少 3 至 4 倍。
  • •基准测试结果为自我报告,独立测试仅在权重公开发布后才会开始。
  • •Reflection AI 由前 Google DeepMind 研究人员于 2024 年 3 月创立,已融资超过 40 亿美元,投前估值 250 亿美元,投资方包括 Nvidia、红杉资本和花旗集团,并与美国国防部及能源部保持合作关系。
Reflection AI 发布 5010 亿参数开源权重模型 Beam,将于本月晚些时候正式推出

Reflection AI 发布了开源权重人工智能模型 Beam,其总参数量达 5010 亿,完整版本预计将于本月晚些时候推出。

该公司于 2026 年 10 月 5 日宣布了这一模型,并将 Beam 定位为对那些悄然占据大量开发者工作负载的中国开源模型的西方回应。此类开源权重发布意味着模型的训练参数可供下载,企业可以检查、调整并在自己的基础设施上运行该模型,而不必完全依赖提供商的托管服务。

为效率而生的稀疏架构

Beam 采用技术上称为稀疏混合专家(sparse Mixture-of-Experts)的架构。尽管其总参数量为 5010 亿,但每个 token(文本的基本单位,大约相当于一个词或词的一部分)仅激活 230 亿参数。这一区别至关重要,因为决定模型运行成本的是激活参数,而非总参数。一个每次仅调用自身一小部分的超大规模模型,可以在不为每次回复烧钱的情况下保持强大能力。

Reflection 表示,Beam 基于 23.8 万亿 token 进行预训练,随后经历了大规模强化学习——模型在此过程中练习任务并因良好的回答获得奖励。该公司在 10,500 块 NVIDIA GB300 GPU 上运行了超过 1 亿次此类练习推演。

基准测试表现

Reflection 将 Beam 与两款特定的中国竞争对手进行对比:Z.ai 的 GLM-5.2 和阿里巴巴的 Qwen 3.8-Max。根据该公司的声明,Beam 在性能上达到或接近这些模型,尤其是在推理和编程方面。

Beam 在测试模型能否修复真实软件漏洞的 SWE-Bench Verified 上得分 80.9,在衡量模型在命令行环境中运行能力的 Terminal Bench v2.1 上得分 80.1。Reflection 表示,Beam 在推理计算量减少 3 至 4 倍的情况下达到了这一竞争水平。

这些基准测试结果目前为自我报告,技术报告尚未发布。独立测试将在权重发布后开始。

完整的模型权重和技术文档计划于 2026 年 10 月晚些时候以 Apache 2.0 许可证发布——这是目前最宽松的开源许可证之一,通常允许企业在几乎没有限制的情况下使用、修改和商业化该软件。

背后的团队

Reflection AI 是一家美国初创公司,由前 Google DeepMind 研究人员于 2024 年 3 月创立。

自成立以来,该公司已融资超过 40 亿美元,其最新一轮融资使投前估值达到 250 亿美元。投资方包括 Nvidia、红杉资本(Sequoia)和花旗集团(Citigroup)。

该公司还与华盛顿建立了联系,其合作伙伴关系包括与美国国防部和美国能源部的合作。Reflection 表示,其重心正转向为面向企业客户的可扩展 AI。

为什么中国角度重要

开源模型市场存在一个地理问题,至少从美国的角度来看是如此。据报道,中国开源模型近期已占据超过 30% 的 token 份额,而 Reflection 押注市场对本国产替代方案存在真实需求。Token 份额追踪通过不同模型处理的文本量,是衡量实际使用情况的粗略指标。其宣称的目标是为西方用户提供不依赖中国提供商的强大开源权重选择。

对于政府机构和受监管行业而言,模型的来源可能与性能同等重要。Reflection美国国防部及能源部的合作表明,它正在大力强调这一论点。

这意味着什么

对于企业买家来说,效率声明是值得关注的关键。如果 Beam 真能以减少 3 至 4 倍的推理计算量提供相当的推理和编程性能,这将改变自托管模式的成本核算——在自托管场景中,推理成本随每次查询反复产生,并随使用量直接扩大。

风险也很明显。自我报告的基准测试历来在发布帖中的表现好于实际环境,而编程得分尤其容易受到测试运行方式的影响。值得关注的关键日期是 2026 年 10 月晚些时候计划中的权重发布和技术报告。

来源:CryptoBriefing