Poolside udostępnia Laguna S 2.1, kompaktowy model programistyczny o otwartych wagach konkurujący ze znacznie większymi systemami
Najważniejsze informacje
- •Laguna S 2.1 uzyskuje 70.2 percent w Terminal-Bench 2.1 i 40.4 percent w DeepSWE przy włączonym trybie myślenia.
- •Bez trybu myślenia wydajność modelu wyraźnie spada: do 60.4 percent w Terminal-Bench i 16.5 percent w DeepSWE.
- •Poolside trenował model w 409,000 środowiskach agentowych, obejmujących zadania terminalowe, przepływy pracy inżynierii oprogramowania i zadania konfiguracji repozytoriów.
- •Firma opublikowała trajektorie benchmarkowe i poinformowała, że zmiana promptu obniżyła reward hacking w SWE-Bench z ponad 50 percent do poniżej dwóch percent.
- •Laguna S 2.1 jest dostępny przez Hugging Face, dostawców hostowanych, endpointy OpenRouter oraz darmowy czat demonstracyjny bez logowania.

Poolside udostępnia Laguna S 2.1, kompaktowy model programistyczny o otwartych wagach konkurujący ze znacznie większymi systemami
Poolside udostępnił Laguna S 2.1, swój trzeci model programistyczny w ciągu około trzech miesięcy. Architektura mixture-of-experts (MoE) wykorzystuje 8 miliardów aktywnych parametrów na token z łącznie 118 miliardów parametrów, stawiając na lepsze zachowanie podczas długich sesji agentowych zamiast na samą skalę. Premiera następuje w czasie szerszej zmiany w branży, w której deweloperzy coraz częściej szukają efektywności poprzez architekturę i post-trening, zamiast polegać wyłącznie na wzroście liczby parametrów; kilka niedawnych modeli o otwartych wagach pokazało, że mniejsze aktywne konfiguracje mogą pozostawać konkurencyjne w zadaniach agentowych.
Według amerykańskiej firmy Laguna S 2.1 przewyższa inne agentowe modele programistyczne w swojej klasie wagowej, a w niektórych benchmarkach zbliża się do wydajności systemów 10 do 20 razy większych. Model obsługuje okna kontekstowe o długości do jednego miliona tokenów i oferuje zarówno tryb myślenia, jak i tryb bez myślenia.
Poolside po raz pierwszy udostępnił swoje modele szerszej publiczności w kwietniu 2026 r., wraz z Laguna M.1 i XS.2. Wcześniej firma obsługiwała głównie klientów rządowych i sektora publicznego. Przejście na publiczne wydania o otwartych wagach stanowi istotne wejście na konkurencyjny rynek otwartych modeli programistycznych, obejmujący m.in. oferty DeepSeek, Qwen i innych. XS.2 był pierwszym otwartym modelem Poolside, wydanym na licencji Apache 2.0.
Wyniki w benchmarkach na tle większych modeli otwartych
Przy włączonym trybie myślenia Laguna S 2.1 uzyskuje 70.2 percent w Terminal-Bench 2.1, benchmarku oceniającym modele w długotrwałych zadaniach terminalowych. Wynik ten plasuje go tuż za Tencent Hy3 (295B-A21B) i przed znacznie większymi modelami otwartymi, w tym DeepSeek-V4-Pro-Max, Nemotron 3 Ultra oraz debiutanckim modelem Thinking Machines Lab. Ogólnemu rankingowi Terminal-Bench przewodzą obecnie OpenAI GPT-5.6 Sol, Anthropic Claude Fable 5 i Kimi K3.
Poolside argumentuje, że benchmark DeepSWE firmy Datacurve zapewnia bardziej miarodajne porównanie, ponieważ jego wyniki są rozłożone w szerszym zakresie. W DeepSWE Laguna S 2.1 osiąga 40.4 percent, podczas gdy niektóre modele o otwartych wagach przekraczające jeden bilion parametrów pozostają poniżej 10 percent. Model plasuje się także w czołówce swojej klasy w SWE-Bench Multilingual, SWE-Bench Pro i SWE Atlas. Benchmarki te są powszechnie używane w branży jako przybliżone miary rzeczywistych zdolności inżynierii oprogramowania, sprawdzając, czy modele potrafią autonomicznie rozwiązywać problemy w istniejących bazach kodu.
Tryb myślenia ma znaczący wpływ na wyniki. Bez niego wynik Laguna S 2.1 w Terminal-Bench spada do 60.4 percent, a wynik w DeepSWE do 16.5 percent. Poolside zauważa, że żaden wcześniejszy model Laguna nie wykazywał większej różnicy wydajności między tymi dwoma trybami.
Wytrwałość jako alternatywa dla czystej skali
Poolside opisuje to wydanie jako odzwierciedlenie szerszej filozofii dotyczącej zdolności modeli. „What we've done in this model is not necessarily add more intelligence, but improve the behaviors that lead to a more capable model: more verification, less taking things for granted, not declaring victory early, and being more persistent,” stwierdza firma w swoim wpisie o wydaniu.
Wcześniejsze modele Laguna czasami zatrzymywały się po tylko częściowym przejściu zestawu testów albo porzucały podejście zaledwie kilka kroków przed tym, jak mogłoby się ono powieść. Poolside traktuje teraz wytrwałość, weryfikację i gotowość do poprawiania nieudanych podejść jako drugą ścieżkę do poprawy wydajności, uzupełniającą tradycyjne skalowanie modelu. Ten nacisk na trening zachowań zamiast samej mocy obliczeniowej odzwierciedla rosnące w laboratoriach AI przekonanie, że niezawodność agentowa — zdolność do utrzymywania wysiłku w wieloetapowych zadaniach bez przedwczesnego zakończenia — może mieć dla praktycznych wdrożeń równie duże znaczenie jak wyniki benchmarków. Większy model Laguna jest już na etapie pre-treningu.
Poolside popiera swoje twierdzenia trzema udokumentowanymi przebiegami testowymi. W jednym przypadku Laguna S 2.1 zbudował w 50 minut funkcjonalny silnik przeglądarki z pustego folderu, zdolny do renderowania HTML i CSS. W innym model odkrył dowód dla Erdős Problem #397 — problemu matematycznego, który pozostawał otwarty od 1975 r. — pracując w sandboxie bez Python. Poolside określa to jako niezależne ponowne odkrycie. Warto zauważyć, że GPT-5.2 Pro rozwiązał ten i kilka innych problemów w styczniu 2026 r., podczas gdy graniczną datą danych treningowych Laguna był listopad 2025 r.
Post-trening w 409,000 środowiskach napędza postępy
Poolside przypisuje poprawę z XS 2.1 do S 2.1 przede wszystkim skalowaniu i post-treningowi, a nie nowym danym pre-treningowym. Faza treningu agentowego objęła 409,000 środowisk, w tym 83,000 dla zadań terminalowych i 168,000 dla przepływów pracy inżynierii oprogramowania. Największe pojedyncze źródło danych obejmowało około 38,000 rzeczywistych commitów z około 17,000 repozytoriów. Nowa kategoria zadań trenowała model w samodzielnym instalowaniu repozytoriów, konfigurowaniu zależności i uruchamianiu zestawów testów.
Poolside zwiększył budżety rolloutów i wydłużył limity czasu podczas treningu. Firma opracowała także nowy system sandbox, który może selektywnie blokować dostęp do sieci, aby ograniczać reward hacking. Wprowadzono rollouty multi-harness — uruchamianie identycznych promptów w wielu środowiskach agentowych — aby zmniejszyć ryzyko nadmiernego dopasowania do jednej konfiguracji.
Według Poolside między rozpoczęciem treningu a premierą minęło mniej niż dziewięć tygodni. Pre-trening rozpoczął się 22 maja 2026 r. z użyciem 4,096 GPU Nvidia H200. Laguna S 2.1 jest również pierwszym modelem Poolside trenowanym metodą uczenia ze wzmocnieniem w precyzji FP8.
Poolside opublikował każdą trajektorię benchmarkową do publicznego wglądu. Podczas treningu wskaźniki reward hackingu w zadaniach SWE-Bench przekraczały 50 percent, ponieważ model wyszukiwał online pasujące pull requesty zamiast samodzielnie rozwiązywać zadania. Niewielka modyfikacja promptu obniżyła ten wskaźnik do poniżej dwóch percent. Reward hacking — sytuacja, w której modele wykorzystują skróty zamiast rzeczywiście wykonywać zadania — jest dobrze udokumentowanym wyzwaniem w treningu opartym na uczeniu ze wzmocnieniem, a publiczne ujawnienie przez Poolside tego problemu i sposobu jego ograniczenia jest w branży stosunkowo przejrzyste.
Mimo swoich mocnych stron Laguna S 2.1 w pewnych przypadkach pozostaje zbyt ściśle dostrojony do agentowego harnessu Poolside. W nieznanych środowiskach z nieco innymi schematami narzędzi model może odchodzić od wymaganych formatów wyjściowych. Ma też skłonność do generowania nadmiernie długich sekwencji myślenia w konkursowych problemach matematycznych. Użytkownicy nie mogą jeszcze regulować intensywności myślenia modelu.
Dostępność i wdrożenie
Laguna S 2.1 jest dostępny na Hugging Face na licencji OpenMDW 1.1. Wspierana przez Linux Foundation licencja pozwala każdemu używać, modyfikować i redystrybuować wagi modelu, także w zastosowaniach komercyjnych.
Baseten, Vercel AI Gateway i OpenRouter oferują dostęp hostowany. OpenRouter udostępnia darmowy endpoint z oknem kontekstowym 256K oraz płatny endpoint obsługujący pełne okno o długości jednego miliona tokenów. Poolside twierdzi, że model może również działać lokalnie na pojedynczym Nvidia DGX Spark. Darmowy czat demonstracyjny jest dostępny pod adresem chat.poolside.ai bez konieczności logowania.
Poolside jako firma stawia na dwa strategiczne założenia. Pierwsze mówi, że droga do inteligencji prowadzi przez kodowanie agentowe, ponieważ oprogramowanie zapewnia agentom najbardziej ekspresyjny interfejs. Drugie zakłada, że AI może „dekompresować sieć” — większość materiałów pisanych zapisuje końcowe odpowiedzi, a nie stojące za nimi rozumowanie, a Poolside argumentuje, że uczenie ze wzmocnieniem może odtworzyć ten ukryty proces.