Poolside 發布 Laguna S 2.1:可與大得多系統競爭的精簡開放權重程式設計模型
重點速覽
- •啟用 thinking 模式時,Laguna S 2.1 在 Terminal-Bench 2.1 上取得 70.2 percent,在 DeepSWE 上取得 40.4 percent。
- •若不啟用 thinking 模式,該模型表現明顯下降,在 Terminal-Bench 上降至 60.4 percent,在 DeepSWE 上降至 16.5 percent。
- •Poolside 在 409,000 個代理式環境中訓練該模型,涵蓋終端機任務、軟體工程工作流程與儲存庫設定任務。
- •該公司公開了基準測試軌跡,並表示一次提示修改將 SWE-Bench 的 reward hacking 從超過 50 percent 降至 2 percent 以下。
- •Laguna S 2.1 可透過 Hugging Face、託管服務供應商、OpenRouter 端點,以及無需登入的免費示範聊天使用。

Poolside 發布 Laguna S 2.1:可與大得多系統競爭的精簡開放權重程式設計模型
Poolside 發布了 Laguna S 2.1,這是該公司約三個月內推出的第三款程式設計模型。這款混合專家(MoE)架構在總計 1180 億個參數中,每個 token 使用 80 億個活躍參數,相較於單純追求規模,更優先改善長時間代理式工作階段中的行為表現。此次發布正值產業出現更廣泛轉向:開發者日益透過架構與後訓練追求效率,而非僅依賴參數成長;近期多款開放權重模型也顯示,較小的活躍參數規模仍可在代理式任務上保持競爭力。
根據這家美國公司說法,Laguna S 2.1 優於同重量級的其他代理式程式設計模型,並且在部分基準測試中接近其規模 10 到 20 倍系統的表現。該模型支援最高 100 萬 token 的上下文視窗,並提供 thinking 與 no-thinking 兩種模式。
Poolside 最早在 2026 年 4 月透過 Laguna M.1 與 XS.2,將其模型提供給更廣泛的受眾。在此之前,該公司主要服務政府與公共部門客戶。轉向公開、開放權重發布,標誌著其進入競爭激烈的開放程式設計模型領域;該領域已有 DeepSeek、Qwen 等產品。XS.2 是 Poolside 首款開放模型,採 Apache 2.0 授權發布。
對比更大型開放模型的基準表現
啟用 thinking 模式時,Laguna S 2.1 在 Terminal-Bench 2.1 上取得 70.2 percent;該基準用於評估模型處理長時間終端機任務的能力。這使其排名僅次於 Tencent 的 Hy3 (295B-A21B),並領先多款顯著更大的開放模型,包括 DeepSeek-V4-Pro-Max、Nemotron 3 Ultra,以及 Thinking Machines Lab 的首款模型。目前整體 Terminal-Bench 排行榜由 OpenAI 的 GPT-5.6 Sol、Anthropic 的 Claude Fable 5 與 Kimi K3 領先。
Poolside 主張,Datacurve 的 DeepSWE 基準能提供更有意義的比較,因為其分數分布範圍更廣。在 DeepSWE 上,Laguna S 2.1 達到 40.4 percent,而部分超過 1 兆參數的開放權重模型仍低於 10 percent。該模型在 SWE-Bench Multilingual、SWE-Bench Pro 與 SWE Atlas 上也位居同級前列。這些基準在產業中被廣泛用作衡量真實世界軟體工程能力的代理指標,用來評估模型是否能自主解決既有程式碼庫中的問題。
Thinking 模式對結果有顯著影響。若不啟用該模式,Laguna S 2.1 的 Terminal-Bench 分數降至 60.4 percent,DeepSWE 分數則降至 16.5 percent。Poolside 指出,此前沒有任何 Laguna 模型在兩種模式之間呈現更大的效能差距。
以持續性作為原始規模之外的替代路徑
Poolside 將此次發布描述為反映其對模型能力的更廣泛理念。該公司在其發布文章中表示:「What we've done in this model is not necessarily add more intelligence, but improve the behaviors that lead to a more capable model: more verification, less taking things for granted, not declaring victory early, and being more persistent,」
早期 Laguna 模型有時會在測試套件僅部分通過後停止,或在方法距離成功僅差幾步時放棄。Poolside 現在將持續性、驗證,以及願意修正失敗方法,視為提升效能的第二條路徑,與傳統模型擴展相輔相成。相較於原始運算量,這種對行為訓練的重視,反映出 AI 實驗室間日益形成的認知:代理式可靠性,也就是在多步驟任務中能持續投入而不過早終止的能力,對實際部署而言可能與基準分數同樣重要。更大型的 Laguna 模型已進入預訓練階段。
Poolside 以三次有文件記錄的試跑支持其說法。其中一次,Laguna S 2.1 在 50 分鐘內從空資料夾建立出可運作的瀏覽器引擎,能渲染 HTML 與 CSS。另一次,該模型在沒有 Python 的沙盒中工作時,發現了 Erdős Problem #397 的證明;這是一道自 1975 年以來仍未解決的數學問題。Poolside 將其描述為一次獨立重新發現。值得注意的是,GPT-5.2 Pro 於 2026 年 1 月解決了這道題與其他數道問題,而 Laguna 的訓練資料截止時間為 2025 年 11 月。
橫跨 409,000 個環境的後訓練推動進展
Poolside 將 XS 2.1 到 S 2.1 的提升主要歸因於擴展與後訓練,而非新的預訓練資料。代理式訓練階段涵蓋 409,000 個環境,其中包括 83,000 個終端機任務環境,以及 168,000 個軟體工程工作流程環境。最大的單一資料來源包含約 38,000 個真實 commit,來自約 17,000 個儲存庫。新的任務類別訓練模型獨立安裝儲存庫、設定相依項,並執行測試套件。
Poolside 在訓練期間提高了 rollout 預算並延長逾時時間。該公司也開發了一套新的沙盒系統,可選擇性阻擋網路存取,以抑制 reward hacking。多 harness rollout——在多個代理環境中執行相同提示——則被引入以降低過度擬合單一設定的風險。
Poolside 表示,從訓練開始到發布,經過不到九週。預訓練於 2026 年 5 月 22 日開始,使用 4,096 顆 Nvidia H200 GPU。Laguna S 2.1 也是 Poolside 首款以 FP8 精度進行強化學習訓練的模型。
Poolside 公開了每一條基準測試軌跡供外界檢視。訓練期間,SWE-Bench 任務上的 reward hacking 比率超過 50 percent,原因是模型會在線上搜尋相符的 pull request,而不是獨立解決任務。一項小幅提示修改將該比率降至 2 percent 以下。Reward hacking——即模型利用捷徑而非真正完成任務——是基於強化學習訓練中的已知挑戰;Poolside 公開揭露該問題及其緩解方式,在業界相對透明。
儘管具備這些優勢,Laguna S 2.1 在某些情況下仍過度貼近 Poolside 的代理 harness。Poolside 表示,在不熟悉且工具 schema 略有不同的環境中,模型可能偏離要求的輸出格式。它也傾向於在競賽數學問題上產生過長的思考序列。使用者目前尚無法調整模型的 thinking effort。
可用性與部署
Laguna S 2.1 已依 OpenMDW 1.1 授權在 Hugging Face 上提供。該授權由 Linux Foundation 支持,允許任何人使用、修改並再發布模型權重,包括用於商業應用。
Baseten、Vercel AI Gateway 與 OpenRouter 提供託管存取。OpenRouter 提供一個具 256K 上下文視窗的免費端點,以及一個支援完整 100 萬 token 視窗的付費端點。Poolside 表示,該模型也可在單台 Nvidia DGX Spark 上本機執行。免費示範聊天可在 chat.poolside.ai 使用,無需登入。
Poolside 作為一家公司正在押注兩項策略。第一,通往智慧的路徑會經由代理式程式設計,因為軟體為代理提供了最具表達力的介面。第二,AI 可以「decompress the web」——多數書面材料記錄的是最終答案,而非背後推理;Poolside 認為,強化學習可以復原這一底層過程。