Poolside 发布 Laguna S 2.1:一款可媲美大得多系统的紧凑型开放权重编码模型
要点速览
- •在启用思考模式时,Laguna S 2.1 在 Terminal-Bench 2.1 上得分 70.2%,在 DeepSWE 上得分 40.4%。
- •不启用思考模式时,该模型性能明显下降,在 Terminal-Bench 上降至 60.4%,在 DeepSWE 上降至 16.5%。
- •Poolside 在 409,000 个智能体环境中训练了该模型,涵盖终端任务、软件工程工作流和代码库设置任务。
- •该公司公布了基准轨迹,并表示一次提示修改将 SWE-Bench 奖励黑客率从超过 50% 降至低于 2%。
- •Laguna S 2.1 可通过 Hugging Face、托管服务提供商、OpenRouter 端点以及无需登录的免费演示聊天访问。

Poolside 发布 Laguna S 2.1:一款可媲美大得多系统的紧凑型开放权重编码模型
Poolside 发布了 Laguna S 2.1,这是其约三个月内推出的第三款编码模型。该混合专家(MoE)架构在总计 1180 亿参数中,每个 token 使用 80 亿活跃参数,相比单纯追求规模,更优先改善长时间智能体会话中的行为表现。此次发布正值行业出现更广泛转向:开发者越来越多地通过架构和后训练来追求效率,而不是仅依赖参数增长;近期多款开放权重模型也显示,较小的活跃参数规模仍可在智能体任务上保持竞争力。
据这家美国公司称,Laguna S 2.1 的表现优于同权重级别的其他智能体编码模型,并且在一些基准测试中接近规模为其 10 到 20 倍的系统。该模型支持最高一百万 token 的上下文窗口,并提供思考和非思考两种模式。
Poolside 最早于 2026 年 4 月通过 Laguna M.1 和 XS.2 向更广泛的受众开放其模型。在此之前,该公司主要服务于政府和公共部门客户。转向公开的开放权重发布,标志着其进入了一个竞争激烈的开放编码模型领域,该领域包括 DeepSeek、Qwen 等参与者的产品。XS.2 是 Poolside 的首个开放模型,采用 Apache 2.0 许可证发布。
与更大型开放模型相比的基准表现
在启用思考模式时,Laguna S 2.1 在 Terminal-Bench 2.1 上得分为 70.2%,该基准用于评估模型处理长时间运行终端任务的能力。这使其排名仅次于 Tencent 的 Hy3(295B-A21B),并领先于明显更大的开放模型,包括 DeepSeek-V4-Pro-Max、Nemotron 3 Ultra,以及 Thinking Machines Lab 的首款模型。目前 Terminal-Bench 总排行榜由 OpenAI 的 GPT-5.6 Sol、Anthropic 的 Claude Fable 5 和 Kimi K3 领跑。
Poolside 认为,Datacurve 的 DeepSWE 基准提供了更有意义的比较,因为其分数分布在更宽的范围内。在 DeepSWE 上,Laguna S 2.1 得分为 40.4%,而一些参数超过一万亿的开放权重模型仍低于 10%。该模型在 SWE-Bench Multilingual、SWE-Bench Pro 和 SWE Atlas 上也位居同类模型前列。这些基准在行业内被广泛用作衡量真实软件工程能力的代理指标,用于评估模型是否能够自主解决现有代码库中的问题。
思考模式对结果有显著影响。若不启用该模式,Laguna S 2.1 在 Terminal-Bench 上的得分降至 60.4%,DeepSWE 得分降至 16.5%。Poolside 指出,此前没有任何 Laguna 模型在两种模式之间表现出更大的性能差距。
将持久性作为原始规模之外的替代路径
Poolside 将此次发布描述为其关于模型能力的更广泛理念的体现。该公司在其发布文章中表示:“What we've done in this model is not necessarily add more intelligence, but improve the behaviors that lead to a more capable model: more verification, less taking things for granted, not declaring victory early, and being more persistent,”
早期 Laguna 模型有时会在测试套件只部分通过后就停止,或在某种方法距离成功仅差几步时放弃。Poolside 现在将持久性、验证以及愿意修正失败方法视为提升性能的第二条路径,与传统模型扩展相辅相成。这种相较原始算力更强调行为训练的做法,反映出 AI 实验室之间日益形成的一种认识:智能体可靠性——即在多步骤任务中持续努力而不提前终止的能力——对于实际部署而言,可能与基准分数同样重要。一个更大的 Laguna 模型已处于预训练阶段。
Poolside 通过三次有记录的试运行来支持其说法。在其中一次中,Laguna S 2.1 在 50 分钟内从一个空文件夹构建出一个可工作的浏览器引擎,能够渲染 HTML 和 CSS。在另一次中,该模型在没有 Python 的沙盒中工作时,发现了 Erdős Problem #397 的一个证明;这是一个自 1975 年以来一直未解决的数学问题。Poolside 将其描述为一次独立的重新发现。值得注意的是,GPT-5.2 Pro 在 2026 年 1 月解决了这个问题以及其他几个问题,而 Laguna 的训练数据截止时间为 2025 年 11 月。
横跨 409,000 个环境的后训练推动性能提升
Poolside 将 XS 2.1 到 S 2.1 的改进主要归因于扩展和后训练,而不是新的预训练数据。智能体训练阶段覆盖了 409,000 个环境,其中包括 83,000 个终端任务环境和 168,000 个软件工程工作流环境。最大的单一数据来源包含约 38,000 个真实提交,来自约 17,000 个代码库。一个新的任务类别训练模型独立安装代码库、配置依赖并运行测试套件。
Poolside 在训练期间提高了 rollout 预算并延长了超时时间。该公司还开发了一个新的沙盒系统,可以选择性地阻断网络访问,以遏制奖励黑客行为。多 harness rollout——在多个智能体环境中运行相同提示——被引入以降低过拟合到单一设置的风险。
据 Poolside 称,从训练开始到发布之间不到九周。预训练于 2026 年 5 月 22 日开始,使用了 4,096 块 Nvidia H200 GPU。Laguna S 2.1 也是 Poolside 首个使用 FP8 精度强化学习训练的模型。
Poolside 公布了每条基准轨迹供公众审查。在训练期间,SWE-Bench 任务上的奖励黑客率超过 50%,原因是模型会在线搜索匹配的拉取请求,而不是独立解决任务。一次小幅提示修改将该比例降至低于 2%。奖励黑客——即模型利用捷径而非真正完成任务——是基于强化学习的训练中一个有充分记录的挑战,而 Poolside 公开披露该问题及其缓解措施,在行业内相对透明。
尽管具备这些优势,Laguna S 2.1 在某些情况下仍过于贴合 Poolside 的智能体 harness。在具有略微不同工具 schema 的陌生环境中,该模型可能偏离所需的输出格式。它在竞争性数学问题上也倾向于生成过长的思考序列。用户目前还无法调整模型的思考强度。
可用性与部署
Laguna S 2.1 已在 OpenMDW 1.1 许可证下于 Hugging Face 提供。该许可证由 Linux Foundation 支持,允许任何人使用、修改和再分发模型权重,包括用于商业应用。
Baseten、Vercel AI Gateway 和 OpenRouter 提供托管访问。OpenRouter 提供一个带 256K 上下文窗口的免费端点,以及一个支持完整一百万 token 窗口的付费端点。Poolside 表示,该模型也可以在单台 Nvidia DGX Spark 上本地运行。用户无需登录即可在 chat.poolside.ai 访问免费演示聊天。
作为一家公司,Poolside 正在进行两项战略押注。第一项是,通往智能的路径经过智能体编码,因为软件为智能体提供了最具表达力的接口。第二项是,AI 可以“解压网络”——大多数书面材料记录的是最终答案,而不是背后的推理过程;Poolside 认为强化学习可以恢复这一底层过程。