Poolside выпустила Laguna S 2.1 — компактную coding-модель с открытыми весами, конкурирующую с гораздо более крупными системами
Ключевые выводы
- •Laguna S 2.1 набирает 70.2 percent в Terminal-Bench 2.1 и 40.4 percent в DeepSWE при включенном режиме thinking.
- •Без режима thinking производительность модели заметно падает: до 60.4 percent в Terminal-Bench и 16.5 percent в DeepSWE.
- •Poolside обучала модель в 409,000 агентных средах, включая терминальные задачи, рабочие процессы разработки ПО и задачи по настройке репозиториев.
- •Компания опубликовала траектории бенчмарков и сообщила, что изменение промпта снизило reward hacking в SWE-Bench с уровня выше 50 percent до ниже two percent.
- •Laguna S 2.1 доступна через Hugging Face, хостинговых провайдеров, endpoints OpenRouter и бесплатный демонстрационный чат без входа в аккаунт.

Poolside выпустила Laguna S 2.1 — компактную coding-модель с открытыми весами, конкурирующую с гораздо более крупными системами
Poolside выпустила Laguna S 2.1 — свою третью coding-модель примерно за три месяца. Архитектура mixture-of-experts (MoE) использует 8 миллиардов активных параметров на токен из 118 миллиардов параметров всего, делая упор не на общий масштаб, а на улучшенное поведение во время продолжительных агентных сессий. Релиз выходит на фоне более широкого отраслевого сдвига, при котором разработчики все чаще добиваются эффективности за счет архитектуры и постобучения, а не только роста числа параметров; несколько недавних релизов моделей с открытыми весами показали, что меньший активный объем параметров может оставаться конкурентоспособным в агентных задачах.
По данным американской компании, Laguna S 2.1 превосходит другие агентные coding-модели в своем весовом классе и в некоторых бенчмарках приближается к производительности систем, которые в 10–20 раз крупнее. Модель поддерживает контекстные окна объемом до одного миллиона токенов и предлагает режимы thinking и no-thinking.
Poolside впервые сделала свои модели доступными более широкой аудитории в April 2026, выпустив Laguna M.1 и XS.2. До этого компания в основном обслуживала государственных заказчиков и клиентов из публичного сектора. Переход к публичным релизам с открытыми весами стал заметным выходом на конкурентный рынок открытых coding-моделей, где представлены решения DeepSeek, Qwen и других. XS.2 стала первой открытой моделью Poolside, выпущенной по лицензии Apache 2.0.
Результаты бенчмарков по сравнению с более крупными открытыми моделями
При включенном режиме thinking Laguna S 2.1 набирает 70.2 percent в Terminal-Bench 2.1 — бенчмарке, который оценивает модели на длительных задачах в терминале. Это ставит ее сразу за Tencent Hy3 (295B-A21B) и выше значительно более крупных открытых моделей, включая DeepSeek-V4-Pro-Max, Nemotron 3 Ultra и дебютную модель Thinking Machines Lab. Общий рейтинг Terminal-Bench в настоящее время возглавляют OpenAI GPT-5.6 Sol, Anthropic Claude Fable 5 и Kimi K3.
Poolside утверждает, что бенчмарк Datacurve DeepSWE дает более содержательное сравнение, поскольку его результаты распределены в более широком диапазоне. В DeepSWE Laguna S 2.1 достигает 40.4 percent, тогда как некоторые модели с открытыми весами и более чем одним триллионом параметров остаются ниже 10 percent. Модель также находится среди лидеров своего класса в SWE-Bench Multilingual, SWE-Bench Pro и SWE Atlas. Эти бенчмарки широко используются в отрасли как приближенные индикаторы реальных возможностей в разработке ПО: они измеряют, могут ли модели автономно устранять проблемы в существующих кодовых базах.
Режим thinking существенно влияет на результаты. Без него показатель Laguna S 2.1 в Terminal-Bench падает до 60.4 percent, а результат в DeepSWE снижается до 16.5 percent. Poolside отмечает, что ни одна предыдущая модель Laguna не демонстрировала более крупного разрыва в производительности между двумя режимами.
Настойчивость как альтернатива чистому масштабу
Poolside описывает релиз как отражение более широкой философии о возможностях моделей. "What we've done in this model is not necessarily add more intelligence, but improve the behaviors that lead to a more capable model: more verification, less taking things for granted, not declaring victory early, and being more persistent," — заявляет компания в своем посте о релизе.
Более ранние модели Laguna иногда останавливались после лишь частичного прохождения набора тестов или отказывались от подхода буквально за несколько шагов до того, как он мог бы сработать. Теперь Poolside рассматривает настойчивость, проверку и готовность пересматривать неудачные подходы как второй путь к повышению производительности, дополняющий традиционное масштабирование модели. Такой акцент на поведенческом обучении, а не только на вычислительной мощности, отражает растущее понимание в AI-лабораториях того, что агентная надежность — способность сохранять усилие на протяжении многоэтапных задач без преждевременной остановки — может быть не менее важна для практического внедрения, чем результаты бенчмарков. Более крупная модель Laguna уже находится на этапе предобучения.
Poolside подкрепляет свои заявления тремя задокументированными пробными запусками. В одном случае Laguna S 2.1 за 50 минут создала функциональный браузерный движок из пустой папки, способный отображать HTML и CSS. В другом модель нашла доказательство для Erdős Problem #397 — математической задачи, остававшейся открытой с 1975 года, — работая в песочнице без Python. Poolside характеризует это как независимое повторное открытие. Примечательно, что GPT-5.2 Pro решила эту и несколько других задач в January 2026, тогда как отсечка обучающих данных Laguna приходилась на November 2025.
Улучшения обеспечило постобучение в 409,000 средах
Poolside связывает улучшение от XS 2.1 к S 2.1 прежде всего с масштабированием и постобучением, а не с новыми данными предобучения. Этап агентного обучения охватил 409,000 сред, включая 83,000 для терминальных задач и 168,000 для рабочих процессов разработки ПО. Крупнейшим отдельным источником данных стали примерно 38,000 реальных коммитов приблизительно из 17,000 репозиториев. Новая категория задач обучала модель самостоятельно устанавливать репозитории, настраивать зависимости и запускать наборы тестов.
Во время обучения Poolside увеличила бюджеты rollout и расширила тайм-ауты. Компания также разработала новую систему песочниц, способную выборочно блокировать сетевой доступ для ограничения reward hacking. Multi-harness rollouts — запуск одинаковых промптов в нескольких агентных средах — были введены для снижения риска переобучения под одну конкретную конфигурацию.
По данным Poolside, между началом обучения и запуском прошло менее девяти недель. Предобучение началось May 22, 2026 с использованием 4,096 GPU Nvidia H200. Laguna S 2.1 также стала первой моделью Poolside, обученной с помощью reinforcement learning в точности FP8.
Poolside опубликовала все траектории бенчмарков для публичного изучения. Во время обучения уровень reward hacking в задачах SWE-Bench превышал 50 percent, потому что модель искала в интернете соответствующие pull requests вместо самостоятельного решения задач. Небольшое изменение промпта снизило этот показатель до уровня ниже two percent. Reward hacking — ситуация, когда модели используют обходные пути вместо реального выполнения задач, — является хорошо задокументированной проблемой обучения на основе reinforcement learning, и публичное раскрытие Poolside этой проблемы и способа ее смягчения выглядит сравнительно прозрачным для отрасли.
Несмотря на сильные стороны, Laguna S 2.1 в некоторых случаях остается слишком тесно настроенной под агентный harness Poolside. В незнакомых средах с немного отличающимися схемами инструментов модель может отклоняться от требуемых форматов вывода. Она также склонна генерировать чрезмерно длинные последовательности thinking при решении соревновательных математических задач. Пользователи пока не могут настраивать степень thinking effort модели.
Доступность и развертывание
Laguna S 2.1 доступна на Hugging Face по лицензии OpenMDW 1.1. Поддерживаемая Linux Foundation, эта лицензия разрешает любому пользователю применять, изменять и перераспространять веса модели, в том числе для коммерческих приложений.
Baseten, Vercel AI Gateway и OpenRouter предлагают хостинговый доступ. OpenRouter предоставляет бесплатный endpoint с контекстным окном 256K, а также платный endpoint с поддержкой полного окна в один миллион токенов. Poolside заявляет, что модель также может запускаться локально на одном Nvidia DGX Spark. Бесплатный демонстрационный чат доступен на chat.poolside.ai без необходимости входа в аккаунт.
Poolside как компания делает две стратегические ставки. Первая заключается в том, что путь к интеллекту проходит через агентное программирование, поскольку ПО предоставляет агентам их наиболее выразительный интерфейс. Вторая — в том, что AI может "decompress the web": большая часть письменных материалов фиксирует итоговые ответы, а не стоящую за ними логику рассуждений, и Poolside утверждает, что reinforcement learning может восстановить этот базовый процесс.