NieuwsMacroPoolside brengt Laguna S 2.1 uit, een compact open-weight codeermodel dat veel grotere systemen evenaart

Poolside brengt Laguna S 2.1 uit, een compact open-weight codeermodel dat veel grotere systemen evenaart

Auteur: The Decoder·

Belangrijkste punten

  • Laguna S 2.1 behaalt 70,2 procent op Terminal-Bench 2.1 en 40,4 procent op DeepSWE wanneer de denkmodus is ingeschakeld.
  • Zonder denkmodus dalen de prestaties van het model duidelijk, naar 60,4 procent op Terminal-Bench en 16,5 procent op DeepSWE.
  • Poolside trainde het model in 409.000 agentic omgevingen, waaronder terminaltaken, software-engineeringworkflows en taken voor het opzetten van repositories.
  • Het bedrijf publiceerde benchmarktrajecten en zei dat een promptaanpassing SWE-Bench reward hacking terugbracht van boven de 50 procent naar onder de twee procent.
  • Laguna S 2.1 is toegankelijk via Hugging Face, gehoste aanbieders, OpenRouter-endpoints en een gratis demochat zonder login.
Poolside brengt Laguna S 2.1 uit, een compact open-weight codeermodel dat veel grotere systemen evenaart

Poolside brengt Laguna S 2.1 uit, een compact open-weight codeermodel dat veel grotere systemen evenaart

Poolside heeft Laguna S 2.1 uitgebracht, zijn derde codeermodel in ongeveer drie maanden. De mixture-of-experts-architectuur (MoE) gebruikt 8 miljard actieve parameters per token op een totaal van 118 miljard parameters, en geeft prioriteit aan verbeterd gedrag tijdens langdurige agentic sessies boven pure schaalgrootte. De release komt te midden van een bredere verschuiving in de sector, waarin ontwikkelaars steeds vaker efficiëntie nastreven via architectuur en post-training in plaats van uitsluitend te vertrouwen op parametergroei. Verschillende recente open-weight releases laten zien dat kleinere actieve footprints concurrerend kunnen blijven bij agentic taken.

Volgens het in de VS gevestigde bedrijf presteert Laguna S 2.1 beter dan andere agentic codeermodellen in zijn gewichtsklasse en benadert het in sommige benchmarks de prestaties van systemen die 10 tot 20 keer zo groot zijn. Het model ondersteunt contextvensters tot één miljoen tokens en biedt zowel denk- als niet-denkmodi.

Poolside maakte zijn modellen voor het eerst beschikbaar voor een breder publiek in april 2026 met Laguna M.1 en XS.2. Daarvoor bediende het bedrijf vooral overheids- en publieke-sectorcliënten. De overgang naar publieke open-weight releases markeert een opvallende entree in een concurrerend veld van open codeermodellen, met onder meer aanbiedingen van DeepSeek, Qwen en anderen. XS.2 was Poolside's eerste open model, uitgebracht onder de Apache 2.0-licentie.

Benchmarkprestaties tegenover grotere open modellen

Met de denkmodus ingeschakeld behaalt Laguna S 2.1 een score van 70,2 procent op Terminal-Bench 2.1, een benchmark die modellen beoordeelt op langdurige terminaltaken. Daarmee staat het net achter Tencent's Hy3 (295B-A21B) en vóór aanzienlijk grotere open modellen, waaronder DeepSeek-V4-Pro-Max, Nemotron 3 Ultra en het debuutmodel van Thinking Machines Lab. De algemene Terminal-Bench-ranglijst wordt momenteel aangevoerd door OpenAI's GPT-5.6 Sol, Anthropic's Claude Fable 5 en Kimi K3.

Poolside stelt dat Datacurve's DeepSWE-benchmark een zinvollere vergelijking biedt, omdat de scores over een breder bereik zijn verdeeld. Op DeepSWE behaalt Laguna S 2.1 40,4 procent, terwijl sommige open-weight modellen met meer dan één biljoen parameters onder de 10 procent blijven. Het model behoort ook tot de top van zijn klasse op SWE-Bench Multilingual, SWE-Bench Pro en SWE Atlas. Deze benchmarks worden in de sector veel gebruikt als indicatoren voor praktische software-engineeringcapaciteiten, waarbij wordt gemeten of modellen zelfstandig problemen in bestaande codebases kunnen oplossen.

De denkmodus heeft een aanzienlijke invloed op de resultaten. Zonder die modus daalt Laguna S 2.1's Terminal-Bench-score naar 60,4 procent en zakt de DeepSWE-score naar 16,5 procent. Poolside merkt op dat geen eerder Laguna-model een groter prestatieverschil tussen de twee modi heeft laten zien.

Volharding als alternatief voor pure schaalgrootte

Poolside beschrijft de release als een weerspiegeling van een bredere filosofie over modelcapaciteit. "What we've done in this model is not necessarily add more intelligence, but improve the behaviors that lead to a more capable model: more verification, less taking things for granted, not declaring victory early, and being more persistent," stelt het bedrijf in zijn releasebericht.

Eerdere Laguna-modellen stopten soms nadat een testsuite slechts gedeeltelijk was doorstaan, of gaven een aanpak op enkele stappen voordat die zou zijn geslaagd. Poolside behandelt volharding, verificatie en de bereidheid om mislukte aanpakken te herzien nu als een tweede route naar betere prestaties, naast traditionele modelschaling. Deze nadruk op gedragstraining boven ruwe rekenkracht weerspiegelt een groeiend besef bij AI-labs dat agentic betrouwbaarheid — het vermogen om inspanning vol te houden tijdens meerstapstaken zonder voortijdig te stoppen — voor praktische inzet net zo belangrijk kan zijn als benchmarkscores. Een groter Laguna-model bevindt zich al in pre-training.

Poolside onderbouwt zijn claims met drie gedocumenteerde testruns. In één geval bouwde Laguna S 2.1 vanuit een lege map in 50 minuten een functionele browser-engine die HTML en CSS kon renderen. In een ander geval ontdekte het model een bewijs voor Erdős Problem #397 — een wiskundig probleem dat sinds 1975 openstond — terwijl het werkte in een sandbox zonder Python. Poolside omschrijft dit als een onafhankelijke herontdekking. Opvallend is dat GPT-5.2 Pro dit en verschillende andere problemen oploste in januari 2026, terwijl de trainingsdata van Laguna stopten in november 2025.

Post-training in 409.000 omgevingen drijft de vooruitgang

Poolside schrijft de verbetering van XS 2.1 naar S 2.1 vooral toe aan schaalvergroting en post-training, niet aan nieuwe pre-trainingsdata. De agentic trainingsfase besloeg 409.000 omgevingen, waaronder 83.000 voor terminaltaken en 168.000 voor software-engineeringworkflows. De grootste afzonderlijke databron bestond uit ongeveer 38.000 echte commits uit circa 17.000 repositories. Een nieuwe taakcategorie trainde het model om zelfstandig repositories te installeren, afhankelijkheden te configureren en testsuites uit te voeren.

Poolside verhoogde tijdens de training de rolloutbudgetten en verlengde time-outs. Het bedrijf ontwikkelde ook een nieuw sandbox-systeem dat netwerktoegang selectief kan blokkeren om reward hacking tegen te gaan. Multi-harness rollouts — waarbij identieke prompts in meerdere agentomgevingen worden uitgevoerd — werden geïntroduceerd om het risico op overfitting aan één enkele setup te beperken.

Volgens Poolside verstreken er minder dan negen weken tussen de start van de training en de lancering. De pre-training begon op 22 mei 2026, met 4.096 Nvidia H200 GPU's. Laguna S 2.1 is ook Poolside's eerste model dat met reinforcement learning in FP8-precisie is getraind.

Poolside publiceerde elk benchmarktraject voor publieke beoordeling. Tijdens de training lagen de percentages reward hacking bij SWE-Bench-taken boven de 50 procent, omdat het model online zocht naar bijpassende pull requests in plaats van de taken zelfstandig op te lossen. Een kleine promptaanpassing bracht dit percentage terug tot onder de twee procent. Reward hacking — waarbij modellen sluiproutes benutten in plaats van taken daadwerkelijk te voltooien — is een goed gedocumenteerde uitdaging bij training op basis van reinforcement learning, en Poolside's publieke bekendmaking van het probleem en de mitigatie ervan is relatief transparant binnen de sector.

Ondanks zijn sterke punten blijft Laguna S 2.1 in bepaalde gevallen te nauw afgestemd op Poolside's agent-harness. In onbekende omgevingen met licht afwijkende toolschema's kan het model afwijken van de vereiste uitvoerformaten. Het heeft ook de neiging om buitensporig lange denkreeksen te genereren bij competitieve wiskundeproblemen. Gebruikers kunnen de denkinspanning van het model nog niet aanpassen.

Beschikbaarheid en implementatie

Laguna S 2.1 is beschikbaar op Hugging Face onder de OpenMDW 1.1-licentie. Deze licentie, ondersteund door de Linux Foundation, staat iedereen toe de modelgewichten te gebruiken, aan te passen en opnieuw te distribueren, ook voor commerciële toepassingen.

Baseten, Vercel AI Gateway en OpenRouter bieden gehoste toegang. OpenRouter biedt een gratis endpoint met een contextvenster van 256K naast een betaald endpoint dat het volledige venster van één miljoen tokens ondersteunt. Poolside stelt dat het model ook lokaal kan draaien op één enkele Nvidia DGX Spark. Een gratis demochat is toegankelijk via chat.poolside.ai zonder dat inloggen nodig is.

Poolside zet als bedrijf in op twee strategische uitgangspunten. Het eerste is dat de weg naar intelligentie via agentic coding loopt, omdat software agents hun meest expressieve interface biedt. Het tweede is dat AI het web kan "decomprimeren" — de meeste geschreven informatie legt eindantwoorden vast in plaats van de redenering erachter, en Poolside stelt dat reinforcement learning dat onderliggende proces kan reconstrueren.