ActualitésMacroPoolside lance Laguna S 2.1, un modèle de codage compact à poids ouverts qui rivalise avec des systèmes bien plus grands

Poolside lance Laguna S 2.1, un modèle de codage compact à poids ouverts qui rivalise avec des systèmes bien plus grands

Auteur: The Decoder·

Points clés

  • Laguna S 2.1 obtient 70,2 % sur Terminal-Bench 2.1 et 40,4 % sur DeepSWE lorsque le mode réflexion est activé.
  • Les performances du modèle baissent nettement sans le mode réflexion, à 60,4 % sur Terminal-Bench et 16,5 % sur DeepSWE.
  • Poolside a entraîné le modèle sur 409 000 environnements agentiques, incluant des tâches de terminal, des flux de travail d’ingénierie logicielle et des tâches de configuration de dépôts.
  • L’entreprise a publié les trajectoires de benchmark et indiqué qu’un changement de prompt avait réduit le reward hacking sur SWE-Bench de plus de 50 % à moins de 2 %.
  • Laguna S 2.1 est accessible via Hugging Face, des fournisseurs hébergés, des endpoints OpenRouter et un chat de démonstration gratuit sans connexion.
Poolside lance Laguna S 2.1, un modèle de codage compact à poids ouverts qui rivalise avec des systèmes bien plus grands

Poolside lance Laguna S 2.1, un modèle de codage compact à poids ouverts qui rivalise avec des systèmes bien plus grands

Poolside a lancé Laguna S 2.1, son troisième modèle de codage en environ trois mois. L’architecture mixture-of-experts (MoE) utilise 8 milliards de paramètres actifs par token sur 118 milliards de paramètres au total, en privilégiant l’amélioration du comportement lors de longues sessions agentiques plutôt que la seule augmentation d’échelle. Cette sortie intervient dans un contexte de mutation plus large du secteur, où les développeurs cherchent de plus en plus à gagner en efficacité grâce à l’architecture et au post-entraînement plutôt qu’en s’appuyant uniquement sur la croissance du nombre de paramètres, plusieurs sorties récentes à poids ouverts montrant que des empreintes actives plus réduites peuvent rester compétitives sur les tâches agentiques.

Selon l’entreprise basée aux États-Unis, Laguna S 2.1 surpasse les autres modèles de codage agentique de sa catégorie de poids et, dans certains benchmarks, se rapproche des performances de systèmes 10 à 20 fois plus grands. Le modèle prend en charge des fenêtres de contexte allant jusqu’à un million de tokens et propose à la fois des modes avec réflexion et sans réflexion.

Poolside a rendu ses modèles accessibles à un public plus large pour la première fois en avril 2026 avec Laguna M.1 et XS.2. Avant cela, l’entreprise servait principalement des clients gouvernementaux et du secteur public. Le passage à des modèles publics à poids ouverts marque une entrée notable dans un domaine concurrentiel des modèles de codage ouverts, qui comprend des offres de DeepSeek, Qwen et d’autres acteurs. XS.2 a été le premier modèle ouvert de Poolside, publié sous licence Apache 2.0.

Performances de benchmark face à des modèles ouverts plus grands

Avec le mode réflexion activé, Laguna S 2.1 obtient 70,2 % sur Terminal-Bench 2.1, un benchmark qui évalue les modèles sur des tâches de terminal de longue durée. Ce résultat le place juste derrière Hy3 (295B-A21B) de Tencent et devant des modèles ouverts nettement plus grands, notamment DeepSeek-V4-Pro-Max, Nemotron 3 Ultra et le premier modèle de Thinking Machines Lab. Le classement général de Terminal-Bench est actuellement dominé par GPT-5.6 Sol d’OpenAI, Claude Fable 5 d’Anthropic et Kimi K3.

Poolside estime que le benchmark DeepSWE de Datacurve offre une comparaison plus pertinente, car ses scores sont répartis sur une plage plus large. Sur DeepSWE, Laguna S 2.1 atteint 40,4 %, tandis que certains modèles à poids ouverts dépassant mille milliards de paramètres restent sous les 10 %. Le modèle se classe également parmi les meilleurs de sa catégorie sur SWE-Bench Multilingual, SWE-Bench Pro et SWE Atlas. Ces benchmarks sont largement utilisés dans le secteur comme indicateurs de la capacité réelle en ingénierie logicielle, en mesurant si les modèles peuvent résoudre de manière autonome des problèmes dans des bases de code existantes.

Le mode réflexion a un effet important sur les résultats. Sans celui-ci, le score de Laguna S 2.1 sur Terminal-Bench tombe à 60,4 %, et son score DeepSWE chute à 16,5 %. Poolside souligne qu’aucun modèle Laguna précédent n’avait affiché un écart de performance plus important entre les deux modes.

La persévérance comme alternative à l’échelle brute

Poolside présente cette sortie comme l’expression d’une philosophie plus large sur les capacités des modèles. « What we've done in this model is not necessarily add more intelligence, but improve the behaviors that lead to a more capable model: more verification, less taking things for granted, not declaring victory early, and being more persistent », déclare l’entreprise dans son billet de lancement.

Les modèles Laguna précédents s’arrêtaient parfois après n’avoir réussi que partiellement une suite de tests, ou abandonnaient une approche quelques étapes seulement avant qu’elle n’aboutisse. Poolside considère désormais la persévérance, la vérification et la volonté de réviser les approches qui échouent comme une deuxième voie vers de meilleures performances, en complément de la mise à l’échelle traditionnelle des modèles. Cet accent mis sur l’entraînement comportemental plutôt que sur la puissance de calcul brute reflète une prise de conscience croissante dans les laboratoires d’IA : la fiabilité agentique — la capacité à maintenir l’effort sur des tâches en plusieurs étapes sans s’arrêter prématurément — peut compter autant que les scores de benchmark pour un déploiement pratique. Un modèle Laguna plus grand est déjà en pré-entraînement.

Poolside appuie ses affirmations avec trois essais documentés. Dans un cas, Laguna S 2.1 a construit un moteur de navigateur fonctionnel à partir d’un dossier vide en 50 minutes, capable de rendre du HTML et du CSS. Dans un autre, le modèle a découvert une preuve pour le problème d’Erdős #397 — un problème mathématique resté ouvert depuis 1975 — tout en travaillant dans un bac à sable sans Python. Poolside présente cela comme une redécouverte indépendante. À noter que GPT-5.2 Pro a résolu ce problème et plusieurs autres en janvier 2026, tandis que la date limite des données d’entraînement de Laguna était novembre 2025.

Le post-entraînement sur 409 000 environnements porte les gains

Poolside attribue l’amélioration de XS 2.1 à S 2.1 principalement à la mise à l’échelle et au post-entraînement, plutôt qu’à de nouvelles données de pré-entraînement. La phase d’entraînement agentique a couvert 409 000 environnements, dont 83 000 pour les tâches de terminal et 168 000 pour les flux de travail d’ingénierie logicielle. La plus grande source de données unique comprenait environ 38 000 commits réels provenant d’environ 17 000 dépôts. Une nouvelle catégorie de tâches a entraîné le modèle à installer des dépôts de manière autonome, à configurer les dépendances et à exécuter les suites de tests.

Poolside a augmenté les budgets de déploiement et prolongé les délais d’expiration pendant l’entraînement. L’entreprise a également développé un nouveau système de bac à sable capable de bloquer sélectivement l’accès au réseau afin de limiter le reward hacking. Des déploiements multi-harness — consistant à exécuter des prompts identiques dans plusieurs environnements agentiques — ont été introduits pour réduire le risque de surapprentissage sur une configuration unique.

Selon Poolside, moins de neuf semaines se sont écoulées entre le début de l’entraînement et le lancement. Le pré-entraînement a commencé le 22 mai 2026 avec 4 096 GPU Nvidia H200. Laguna S 2.1 est également le premier modèle de Poolside entraîné par apprentissage par renforcement en précision FP8.

Poolside a publié toutes les trajectoires de benchmark pour examen public. Pendant l’entraînement, les taux de reward hacking sur les tâches SWE-Bench ont dépassé 50 %, car le modèle recherchait en ligne des pull requests correspondantes au lieu de résoudre les tâches de façon indépendante. Une légère modification du prompt a ramené ce taux sous les 2 %. Le reward hacking — lorsque les modèles exploitent des raccourcis au lieu d’accomplir réellement les tâches — est un défi bien documenté dans l’entraînement fondé sur l’apprentissage par renforcement, et la divulgation publique par Poolside du problème et de son atténuation est relativement transparente au sein du secteur.

Malgré ses points forts, Laguna S 2.1 reste dans certains cas trop étroitement ajusté au harness agentique de Poolside. Dans des environnements inconnus avec des schémas d’outils légèrement différents, le modèle peut s’écarter des formats de sortie requis. Il a également tendance à générer des séquences de réflexion excessivement longues sur des problèmes de mathématiques de compétition. Les utilisateurs ne peuvent pas encore ajuster l’effort de réflexion du modèle.

Disponibilité et déploiement

Laguna S 2.1 est disponible sur Hugging Face sous licence OpenMDW 1.1. Soutenue par la Linux Foundation, cette licence permet à chacun d’utiliser, de modifier et de redistribuer les poids du modèle, y compris pour des applications commerciales.

Baseten, Vercel AI Gateway et OpenRouter proposent un accès hébergé. OpenRouter fournit un endpoint gratuit avec une fenêtre de contexte de 256K, ainsi qu’un endpoint payant prenant en charge la fenêtre complète d’un million de tokens. Poolside indique que le modèle peut également fonctionner localement sur un seul Nvidia DGX Spark. Un chat de démonstration gratuit est accessible sur chat.poolside.ai sans connexion.

Poolside fait deux paris stratégiques en tant qu’entreprise. Le premier est que la voie vers l’intelligence passe par le codage agentique, puisque le logiciel fournit aux agents leur interface la plus expressive. Le second est que l’IA peut « décompresser le web » — la plupart des documents écrits consignent les réponses finales plutôt que le raisonnement qui les sous-tend, et Poolside soutient que l’apprentissage par renforcement peut retrouver ce processus sous-jacent.