Poolside выпустила Laguna S 2.1, компактную модель для агентного кодинга

Poolside выпустила Laguna S 2.1, модель типа Mixture-of-Experts (MoE, смесь экспертов) на 118 млрд параметров всего и 8 млрд активных на каждый токен, с контекстным окном до 1 млн токенов в режимах «с размышлением» и «без размышления». От старта обучения до релиза прошло меньше девяти недель. Это уже третья модель компании за три месяца (после более ранних Laguna M.1 и XS.2, о которых Poolside писала ранее).
На бенчмарке Terminal-Bench 2.1 (агент работает через терминал над длинными задачами) Laguna S 2.1 набрала 70.2% с включённым «размышлением» против 60.4% без него. На DeepSWE v1.1 (более сложный и менее насыщенный бенчмарк, где топ-модели разбросаны от 54% до 73%, а некоторые открытые модели на триллион с лишним параметров набирают меньше 10%) модель показала 40.4% с размышлением против 16.5% без него, здесь Poolside отдельно оговаривает, что использовала собственный харнесс (pool), а не mini-swe-agent, применяемый в официальном лидерборде DeepSWE, из-за чего сравнение с другими моделями не полностью прямое. Компания сравнивает Laguna S 2.1 с моделями в разы крупнее, от Tencent Hy3 (295 млрд, 21 млрд активных) до DeepSeek-V4-Pro-Max (1.6 трлн, 49 млрд активных) и Kimi K3 (2.8 трлн, 50 млрд активных), и заявляет, что по компактности и возможностям это самая сильная модель в своём весовом классе, для локального размещения на собственном железе.
Модель работает в двух режимах: «выключено» и «максимум» (включён по умолчанию, сам подбирает бюджет на размышление под задачу); ручной регулировки уровня усилия (низкий/средний/высокий) на старте нет, компания решила выпустить модель без неё, чтобы быстрее дать её пользователям.
Poolside приводит три показательных случая. В первом модель за один 50-минутный сеанс из 181 шага без участия человека с нуля написала работающий движок рендеринга HTML/CSS на JavaScript (токенизатор, парсер CSS со специфичностью селекторов, каскадный движок, layout по блочной модели, canvas-рендерер) и сама проверила корректность результата, сравнивая его скриншоты с реальным браузером через headless Chromium. Во втором модель за несколько часов автономно оптимизировала собственный агентный харнесс компании: ускорила его на 5.2% и снизила потребление памяти примерно на 70%, найдя, среди прочего, квадратичную по сложности склейку строк при накоплении токенов (заменена на буферы) и избыточное копирование при материализации трасс (устранено мемоизацией и точным преаллоцированием памяти); финальный результат проверен детектором гонок Go и go vet. В третьем случае модель за 68 минут в среде без Python (нашла и использовала Perl) независимо передоказала решение проблемы Эрдёша №397 (Эрдёш, Грэм, Рюза, Штраус, 1975) о произведениях центральных биномиальных коэффициентов, задача оставалась открытой более 50 лет, пока в январе 2026 года её не решила GPT-5.2 Pro. Poolside подчёркивает, что у Laguna S 2.1 порог знаний, ноябрь 2025 года, то есть решение GPT-5.2 Pro модель знать не могла; при этом найденная ей конструкция (семейство решений с восемью индексами, растущими линейно) структурно отличается от опубликованной ранее шестииндексной, то есть это независимый, а не заимствованный вывод.
По методологии оценки: агентные бенчмарки, по словам компании, страдают от «reward hacking» (модель обманывает метрику вместо решения задачи), и Poolside в этом релизе публикует полные трассировки (trajectories) всех прогонов финального оценочного набора в открытом доступе на trajectories.poolside.ai, чтобы результаты можно было проверить независимо.
Среди известных ограничений компания сама называет: модель заучивает формат вызова инструментов из своего окружения и может путаться в чуть отличающихся схемах сторонних харнессов (например, терминальный инструмент в Hermes Agent), пока харнесс не поправит её через ре-попытку; при вложенных вызовах инструментов, ожидающих JSON-массив (например, инструмент редактирования в Pi), модель иногда генерирует некорректный или неправильно экранированный JSON; наконец, модель может «пережёвывать» задачу дольше ожидаемого, особенно в олимпиадной математике, управление эффективностью размышления Poolside обещает добавить в следующих версиях.
Ключевые факты
- Laguna S 2.1: MoE-модель на 118 млрд параметров всего и 8 млрд активных на токен, контекст до 1 млн токенов; обучена меньше чем за девять недель, это третий релиз Poolside за три месяца
- Terminal-Bench 2.1: 70.2% с включённым размышлением (60.4% без него); DeepSWE v1.1: 40.4% против 16.5%, при этом Poolside честно указывает, что мерила DeepSWE в своём харнессе, а не в том, что использует официальный лидерборд
- Poolside публикует полные трассировки всех оценочных прогонов на отдельном сайте trajectories.poolside.ai для независимой проверки
- В демонстрационных кейсах модель самостоятельно построила движок рендеринга HTML/CSS с нуля за 50 минут, ускорила собственный агентный харнесс компании на 5.2% при снижении памяти на ~70%, и независимо передоказала решение математической проблемы Эрдёша №397 иным способом, чем это сделала ранее GPT-5.2 Pro
- Признанные компанией ограничения: путаница с форматом инструментов в сторонних агентных харнессах, ошибки в JSON при вложенных вызовах инструментов, и склонность модели затягивать размышление на сложных математических задачах
Почему это важно
Poolside показывает, что для сильных результатов в агентном программировании не обязательно наращивать модель до триллиона с лишним параметров: компактная (по меркам фронтира) Laguna S 2.1 на 118 млрд параметров, по заявлению компании, держится вровень с моделями в разы крупнее на длинных агентных задачах, за счёт продуманного пост-тренинга и управляемого бюджета на размышление, а не только за счёт размера.
Кому это важно
Разработчикам, которым нужна мощная агентная модель кодинга на собственном железе, а не только через облачный API крупных вендоров: компактный размер прямо назван компанией преимуществом для локального размещения. Также важно инженерам, которые следят за трендом «меньше параметров, больше грамотного пост-тренинга», и всем, кто оценивает агентные бенчмарки, из-за практики Poolside публиковать сырые трассировки прогонов.
Как это применить
Модель работает в двух режимах, «размышление выключено» и «максимум» (включён по умолчанию, сам подбирает нужный бюджет на размышление под задачу); ручной регулировки уровня усилия (низкий/средний/высокий) в этом релизе нет, Poolside сознательно выпустила модель без неё, чтобы быстрее довести её до пользователей. Для проверки заявленных результатов и изучения поведения модели на реальных задачах доступны полные трассировки оценочных прогонов на trajectories.poolside.ai, включая три разобранных кейса (движок рендеринга, оптимизация харнесса, доказательство математической задачи).
Можно ли доверять
Компания сама подсвечивает слабые места собственной методологии: агентные бенчмарки страдают от reward hacking, топ-модели по мере созревания бенчмарков сближаются в узком диапазоне баллов, а сравнение на DeepSWE менее прямое, потому что Poolside мерила его в своём харнессе, а не в том, что использует официальный лидерборд. При этом компания публикует полные трассировки всех финальных оценочных прогонов в открытом доступе, редкая по индустрии степень прозрачности, позволяющая независимо перепроверить заявленные цифры, а не просто поверить на слово.
Риски и подводные камни
Сама компания перечисляет ограничения: модель заучивает формат вызова инструментов из своего окружения и путается в чуть иных схемах сторонних агентных харнессов (например, терминальный инструмент Hermes Agent), пока харнесс не поправит её через повторную попытку; при вложенных вызовах инструментов, ожидающих JSON-массив, модель иногда генерирует некорректный JSON; модель может думать дольше ожидаемого, особенно на олимпиадной математике, а контроля над этим бюджетом в этом релизе ещё нет. Отдельно стоит учитывать, что кейс с проблемой Эрдёша №397, не новое открытие: задачу уже решила GPT-5.2 Pro в январе 2026 года, здесь показана лишь независимая передоказка иным путём.
«Laguna S 2.1, насколько мы можем судить, самая способная модель для агентного кодинга в своём весовом классе, и с большим отрывом.»
— Poolside, в блоге о выпуске модели