
Poolside Laguna: версии, бенчмарки, цены и запуск
Poolside Laguna — семейство текстовых моделей для программирующих агентов: они читают репозиторий через инструменты, меняют файлы, запускают команды и проверяют тесты.

Poolside Laguna — семейство текстовых моделей для программирующих агентов: они читают репозиторий через инструменты, меняют файлы, запускают команды и проверяют тесты. На 6 сентября 2026 года разумный выбор сводится к двум моделям: Laguna XS 2.1 для быстрого и локального запуска и Laguna S 2.1 для сложных многошаговых задач. Более крупная Laguna M.1 всё ещё поддерживается и получила открытые веса, но S 2.1 новее, сильнее в актуальных тестах и активирует меньше параметров. Laguna XS.2 нужна в основном для воспроизводимости старых экспериментов: в прямом API её заменила XS 2.1.
Главное преимущество Laguna — открытые веса, длинный контекст и низкая цена hosted-версий. Главный риск — зависимость от агентской оболочки. Высокий результат в pool, родном агенте Poolside, не гарантирует такое же поведение в Cline, Claude Code-совместимой оболочке или самописном tool loop. Перед выбором нужно тестировать не чат, а свой репозиторий, свои инструменты и точную версию inference runtime. Для выбора оболочки и среды разработки полезно сравнить доступные ИИ-сервисы для программирования.
Цены, endpoint и доступность ниже проверены 6 сентября 2026 года. Бесплатные маршруты временные, скидки могут измениться.
Что такое Laguna и что ею не является
Poolside обучает Laguna как foundation models для software engineering. Все выпущенные модели — Mixture of Experts (MoE): в памяти хранятся все веса, но для каждого токена работает только часть экспертов. Обозначение 118B-A8B означает примерно 118 млрд параметров всего и около 8 млрд активных на токен. Это снижает вычислительную нагрузку, но не превращает 118B-модель в файл размером 8B.
У названий Poolside есть несколько уровней:
| Название | Что это | Что не следует из названия |
|---|---|---|
| Laguna XS.2, XS 2.1, S 2.1, M.1 | Конкретные модели и checkpoints | Тариф, хост и агентская оболочка |
pool |
Терминальный coding agent и клиент/сервер Agent Client Protocol (ACP) | Отдельная модель |
| Shimmer | Облачная среда для сборки веб-приложений, API и CLI | Новая версия Laguna |
| chat.poolside.ai | Веб-чат с поиском и базовым выполнением кода | Нативное зрение или встроенный браузер в весах |
| Poolside API, OpenRouter, Vercel, Baseten | Способы получить inference | Новый checkpoint при каждом алиасе |
Модальность у Laguna одна: текст на входе, текст на выходе. Она не видит скриншоты и не принимает аудио. Если агент открывает веб-страницу, читает файл или выполняет тест, это делает инструмент вокруг модели.
Все версии Laguna без путаницы в названиях
Текущая таблица Poolside включает Laguna S 2.1, XS 2.1 и M.1. История семейства содержит ещё XS.2.
| Модель | Дата релиза | Параметры | Контекст | Hosted model ID | Веса | Текущий смысл |
|---|---|---|---|---|---|---|
| Laguna XS.2 | 28 апреля 2026; 256K с 26 мая | 33B-A3B | 262 144 | poolside/laguna-xs.2 |
poolside/Laguna-XS.2, Apache 2.0 |
Предыдущая XS; direct API sunset объявлен в июле |
| Laguna M.1 | 28 апреля 2026; 256K с 26 мая | 225B-A23B | 262 144 | poolside/laguna-m.1 |
poolside/Laguna-M.1, Apache 2.0 |
Крупная модель первого поколения, сейчас open-weight |
| Laguna XS 2.1 | 2 июля 2026 | 33B-A3B | 262 144 | poolside/laguna-xs-2.1 |
poolside/Laguna-XS-2.1, OpenMDW-1.1 |
Быстрая актуальная XS для local и API |
| Laguna S 2.1 | 21 июля 2026 | 118B-A8B | до 1 048 576 | poolside/laguna-s-2.1 |
poolside/Laguna-S-2.1, OpenMDW-1.1 |
Актуальная сильнейшая Laguna |
Точка в XS.2 важна. XS 2.1 — не альтернативное написание того же имени, а новый post-trained checkpoint с более сильным multilingual coding, terminal-задачами и другой лицензией.
Laguna XS.2
XS.2 стала первым открытым релизом Poolside. В ней 40 слоёв: 10 с global attention и 30 со sliding-window attention, 256 routed experts плюс один shared expert, 33 млрд параметров всего и 3 млрд активных. В мае hosted-конфигурацию расширили до 256K.
Модель остаётся доступной как Apache 2.0 checkpoint, но 2 июля Poolside предупредила, что уберёт XS.2 из собственного API через неделю. Для нового проекта выбирать её незачем. Исключения — повтор старого теста, сохранённая интеграция или dedicated deployment в Baseten.
Laguna M.1
M.1 — 225B-A23B MoE из 70 слоёв. После трёх dense-слоёв идут 67 sparse MoE-слоёв с 256 экспертами и top-16 routing. При апрельском запуске Poolside предлагала веса M.1 организациям по запросу. Сейчас официальная коллекция M.1 открыта под Apache 2.0 и содержит post-trained, base, FP8 и NVFP4 варианты.
Дата модели от этого не меняется: M.1 выпущена 28 апреля. Коллекция помечена обновлением 21 июля, а отдельные репозитории — 14 июля. Публичного объявления, которое позволило бы точнее назвать день открытия весов, найти не удалось.
Laguna XS 2.1
XS 2.1 сохранила класс 33B-A3B и 256K, но получила обновлённый post-training. Poolside заявляет рост SWE-bench Multilingual с 57,7% до 63,1% и Terminal-Bench 2.0 с 35,7% до 37,5%.
Коллекция XS 2.1 содержит BF16, FP8, INT4, NVFP4, GGUF и отдельные DFlash speculator models. DFlash — малая draft-модель для speculative decoding, а не «Laguna XS 2.2» и не более умный checkpoint.
Laguna S 2.1
S 2.1 масштабирует второе поколение до 118B-A8B: 48 слоёв, 256 routed experts плюс один shared, 12 global-attention и 36 sliding-window слоёв. Полный контекст — 1 048 576 токенов. Карточка S 2.1 публикует BF16, FP8, INT4, NVFP4, GGUF, MLX и DFlash-варианты.
Это не просто промежуточный размер между XS и M. Новый post-training учит модель дольше держать цель, возвращаться после неудачного подхода и проверять результат. Poolside называет S 2.1 самой сильной моделью семейства, несмотря на меньший общий и активный размер относительно M.1.
Контекст, reasoning и tool use
У Laguna есть native reasoning с рассуждением до и между вызовами инструментов. Poolside называет режим thinking. Для агентского цикла важны три детали.
Первая — сохранять прошлое рассуждение. Если клиент получает reasoning_content или reasoning_details, но при следующем запросе возвращает только финальный текст, модель может перестать корректно рассуждать после tool call.
Вторая — не путать длину контекста и длину ответа. Контекст включает промпт, историю, tool results, reasoning и завершение. На OpenRouter платная S 2.1 допускает 1 048 576 токенов суммарного контекста и до 131 072 completion tokens; бесплатная S и обе XS-маршрута — 262 144 и до 32 768. Это ограничения конкретного провайдера. Poolside не публикует универсальный max output для прямого API.
Третья — проверять tool parser. В API доступны tools и автоматический выбор инструмента, но единственный текущий OpenRouter endpoint не обещает принудительные режимы required и выбор конкретной функции. У S 2.1 есть известная склонность запоминать формат родного harness и ошибаться в похожей схеме стороннего агента. Poolside также отмечает некорректное экранирование вложенных JSON-массивов в некоторых tool calls. Читать полный обзор сервиса OpenRouter.
| Возможность | XS.2 | M.1 | XS 2.1 | S 2.1 |
|---|---|---|---|---|
| Text input/output | Да | Да | Да | Да |
| Изображения, аудио, видео | Нет | Нет | Нет | Нет |
| Interleaved thinking | Да | Да | Да | Да |
| Thinking on/off | Да | Да | Да | Да |
| Low/medium/high effort | Не заявлено | Не заявлено | Не заявлено | Нет, только off/max |
| Tool calling | Да, через совместимый harness | Да | Да | Да |
| Предпочтительный агент | pool или проверенный OpenAI-compatible loop |
pool |
pool |
pool; сторонний harness тестировать отдельно |
Что показывают бенчмарки
Числа ниже полезны для предварительного выбора, но это результаты Poolside, а не единая независимая лига. M.1 и XS.2 опубликованы в техническом отчёте 25 мая; XS 2.1 — в релизе 2 июля.
| Модель | Дата таблицы | SWE-bench Verified | SWE-bench Multilingual | SWE-Bench Pro public | Terminal-Bench 2.0 |
|---|---|---|---|---|---|
| Laguna XS.2 | 25 мая 2026 | 69,9% | 57,7% | 46,3% | 35,7% |
| Laguna M.1 | 25 мая 2026 | 74,6% | 63,1% | 49,2% | 45,8% |
| Laguna XS 2.1 | 2 июля 2026 | 70,9% | 63,1% | 47,6% | 37,5% |
Для S 2.1 Poolside перешла на часть более новых тестов, поэтому честнее держать отдельную таблицу.
| Тест | Версия/срез | Laguna S 2.1 | Условия публикации |
|---|---|---|---|
| Terminal-Bench | 2.1, 21 июля 2026 | 70,2% | max thinking; 60,4% без thinking |
| SWE-bench Multilingual | срез Poolside, 21 июля | 78,5% | pool, до 500 шагов |
| SWE-Bench Pro | public dataset, 21 июля | 59,4% | pool, patched images/verifiers |
| DeepSWE | leaderboard-era срез, 21 июля | 40,4% | max thinking; 16,5% без thinking |
| SWE Atlas | Codebase Q&A, 21 июля | 46,2% | три попытки на задачу |
| Toolathlon | Verified, карточка дополнена 2 сентября | 49,7% | три попытки на задачу |
Почему цифры нельзя читать как турнирную таблицу моделей
Poolside запускала Laguna через Laude Harbor со своим агентом pool, максимумом 500 шагов и sandbox. Для большинства тестов считался средний pass@1 по нескольким попыткам. Terminal-Bench получал больше CPU и RAM, чем остальные задачи. Часть базовых образов и verifier была исправлена из-за инфраструктурных сбоев.
Сравнительные столбцы в релизах собраны из максимального доступного результата конкурента: собственного отчёта вендора, официального leaderboard или Artificial Analysis. Harness у моделей мог отличаться. В DeepSWE Poolside прямо сопоставляет свой pool с результатами, часто полученными в mini-swe-agent.
Есть и риск contamination: задачи SWE-bench публичны, а post-training coding-модели использует историю открытых репозиториев. Poolside проверяла reward hacking и публикует траектории S 2.1, но это не доказывает, что модель никогда не видела близкий паттерн задачи.
На проверенной официальной SWE-bench leaderboard отдельного воспроизведения Laguna в унифицированном bash-only mini-SWE-agent не было. Artificial Analysis запускает Terminal-Bench 2.1 через Terminus 2 и три повтора — это другой harness. Поэтому корректная формулировка: «Poolside сообщает 70,2%», а не «независимый тест доказал лидерство».
Laguna против близких альтернатив
Эта матрица не пытается назвать абсолютного победителя. Она показывает, когда ограничение Laguna меняет выбор.
| Модель | Размер | Контекст | Модальности | Открытые веса | Проверенная API-цена input/output за 1M | Причина выбрать |
|---|---|---|---|---|---|---|
| Laguna XS 2.1 | 33B-A3B | 256K | Text | OpenMDW-1.1 | OpenRouter $0,06/$0,12 | Быстрый local coding agent, дешёвый output, 36–64 GB unified RAM |
| Qwen3.6-35B-A3B | 35B-A3B | 256K native, расширяемый | Text + vision | Open weights | OpenRouter $0,05/$0,70 | Нужны скриншоты/изображения или лучший результат в таблице Qwen: 73,4% SWE Verified и 51,5% Terminal 2.0 |
| Devstral Small 2 | 24B dense | 256K | Text + image | Apache 2.0 | Mistral $0,10/$0,30 | Нужен vision, простой dense deployment и привычный Mistral/Vibe stack |
| Laguna S 2.1 | 118B-A8B | до 1M | Text | OpenMDW-1.1 | OpenRouter $0,09/$0,18 | Нужен сильный text-only agent, длинная trajectory и есть 66–192+ GB memory либо hosted API |
| DeepSeek V4 Flash | 284B-A13B | 1M hosted | Text; vision — отдельный experimental ID | Open weights | Текущая цена не зафиксирована | Нужен альтернативный 1M-provider; локально заметно тяжелее XS/S |
Qwen и Mistral тоже публикуют результаты в собственных scaffold. Даже одинаковая надпись SWE-bench Pro не гарантирует одинаковые task patches и бюджет. Для выбора между XS 2.1 и Qwen3.6 лучше один раз прогнать одинаковый агент и свежие задачи, чем вычитать два процента из разных пресс-релизов.
Где запускать Laguna в 2026 году
Poolside API напрямую
Прямой base URL — https://inference.poolside.ai/v1. API Poolside предоставляет OpenAI-compatible GET /v1/models и POST /v1/chat/completions. Для нового проекта model ID нужно брать из /v1/models после получения ключа: доступ может зависеть от аккаунта.
Публичные материалы называют бесплатный ограниченный доступ и платные endpoints, но полного текущего тарифа, числовых rate limits, SLA и max output по каждой модели на странице API нет. У M.1 особенно важно не строить production-план на словах «free for a limited time».
OpenRouter
OpenRouter удобен для сравнения в одном OpenAI-compatible endpoint. На 6 сентября у Laguna два активных семейства и один провайдер за каждым маршрутом — Poolside.
| OpenRouter ID | Контекст | Max output | Input / 1M | Output / 1M | Cache read / 1M |
|---|---|---|---|---|---|
poolside/laguna-xs-2.1 |
262 144 | 32 768 | $0,06 | $0,12 | $0,03 |
poolside/laguna-xs-2.1:free |
262 144 | 32 768 | $0 | $0 | Не заявлен |
poolside/laguna-s-2.1 |
1 048 576 | 131 072 | $0,09 | $0,18 | $0,009 |
poolside/laguna-s-2.1:free |
262 144 | 32 768 | $0 | $0 | Не заявлен |
poolside/laguna-m.1 |
В каталоге, но 0 endpoints | — | — | — | — |
Это текущие скидочные цены каталога Poolside в OpenRouter. В релизах Poolside указаны list prices: XS 2.1 — $0,10/$0,20/$0,05, S 2.1 — $0,10/$0,20/$0,01. Не переносите скидку OpenRouter на прямой счёт Poolside.
Общие лимиты :free: 20 запросов в минуту и 50 в сутки, если за всё время куплено меньше $10 кредитов; после покупки не менее $10 — 1 000 бесплатных запросов в сутки. Upstream capacity может урезать доступ дополнительно.
Vercel AI Gateway
Vercel AI Gateway предоставляет S 2.1 как poolside/laguna-s-2.1 с 1M и poolside/laguna-s-2.1-free с 256K. Обратите внимание на -free: это не OpenRouter ID с :free. Платная цена — $0,10 input и $0,20 output за 1M. Маршрут удобен проектам на AI SDK, но фактический inference всё равно выполняет Poolside. Читать полный обзор сервиса Vercel.
Baseten и NVIDIA NIM
Baseten Model Library предлагает deployable S 2.1, XS 2.1, M.1 и legacy XS.2. После deployment пользователь получает свой base URL и вызывает OpenAI-compatible API. Публичная карточка не показала универсальный serverless тариф: стоимость зависит от конфигурации и времени GPU.
NVIDIA NIM содержит XS 2.1 с ID poolside/laguna-xs-2.1. Playground/prototype требует аккаунт и ключ. Публичной production-цены в карточке нет.
Together и Fireworks встречаются в общих списках inference-платформ, но текущего официального Laguna endpoint у них найти не удалось. Наличие сервиса не означает наличие этой модели.
Локальный запуск
Для local-first сценария выбирайте официальные Hugging Face checkpoints или Ollama library. Основные runtime:
- Ollama/MLX — простой старт на Apple Silicon;
- llama.cpp — GGUF и CPU/GPU offload, но сверяйте поддержку Laguna и chat template в конкретном build;
- vLLM — OpenAI-compatible сервер на NVIDIA и других поддерживаемых ускорителях;
- SGLang — альтернативный высокопроизводительный server;
- TensorRT-LLM — NVIDIA deployment, где критична совместимая pre-release/stable версия;
- Transformers — исследования и проверка checkpoint; крупные варианты удобнее обслуживать через inference engine.
Официальные карточки указывают poolside_v1 reasoning/tool parser для vLLM и SGLang. На старых builds parser мог пропускать tool calls или не отделять reasoning. Сначала зафиксируйте версию runtime, затем проверяйте один tool call и многошаговую цепочку.
Сколько памяти нужно локально
Есть два разных ответа: размер весов для домашнего запуска и консервативный planning estimate Poolside для поддерживаемого enterprise inference.
| Модель | Доступные официальные ориентиры | Практический вывод |
|---|---|---|
| XS 2.1 | Mac с 36 GB RAM; Ollama Q4/NVFP4 около 20 GB, Q8 36 GB, BF16 67–68 GB; Poolside FP8 planning 96 GB | 36–64 GB unified/system memory — разумная локальная зона; 24 GB GPU может вместить узкий 4-bit вариант, но это inference, а не гарантия полного 256K |
| S 2.1 | BF16 weights около 236 GB; Ollama NVFP4 MLX около 66 GB, Q4 около 96 GB; FP8 planning 192 GB; заявлен запуск на DGX Spark 128 GB | Для серьёзного local agent лучше 96–128+ GB; 1M context требует дополнительной KV memory |
| M.1 | FP8 planning 384 GB; BF16 — крупный multi-GPU checkpoint | Датацентр или dedicated deployment; consumer single-GPU нецелесообразен |
Planning table Poolside не является минимальным требованием. Она учитывает поддерживаемую конфигурацию, но не фиксирует concurrency, batch и длину контекста. Для Kubernetes компания советует ориентироваться минимум на 8 CPU cores на GPU и host RAM не меньше суммарной GPU memory.
Файл Q4 размером 20 GB не означает, что модель с 256K заработает в 20 GB: нужны runtime buffers и KV cache. Чем длиннее история и больше параллельных агентов, тем выше расход.
Цена типовых задач
Расчёты используют скидочные цены OpenRouter на 6 сентября. Один «запрос агента» обычно состоит из многих API calls, поэтому итоговый счёт — сумма всей траектории.
| Сценарий | XS 2.1 | S 2.1 | Комментарий |
|---|---|---|---|
| 50K input + 10K output | $0,0042 | $0,0063 | Короткий анализ или исправление |
| 500K input + 100K output | Не помещается в один 256K request | $0,063 | Требуется платная S с 1M |
| 200K cache read + 30K нового input + 20K output | $0,0102 | $0,0081 | У S очень дешёвый cache-read |
| 400K cache read + 100K нового input + 50K output | Не помещается в один XS request | $0,0216 | Сценарий длинной S-сессии |
Reasoning часто тарифицируется как output. Модель с max thinking может оказаться дороже простой формулы «текст ответа × цена»: считайте usage всего completion, а не только видимый финал.
Hosted Laguna дёшева настолько, что локальный сервер редко окупается только токенами. Self-hosting выбирают ради приватности, фиксированной доступности, экспериментальных checkpoints, контроля latency или постоянной высокой загрузки.
Приватность, ZDR и доступ из регионов
Privacy Policy Poolside допускает использование данных для улучшения сервисов и обучения моделей, если пользователь не отказался, и не называет фиксированный срок хранения API prompts. OpenRouter в общей таблице провайдеров помечает Poolside как «не обучает на prompts», но срок хранения считает неизвестным. Описание бесплатных Laguna в каталоге отдельно предупреждает, что input/output бесплатных запросов могут использоваться для обучения.
Публичные формулировки конфликтуют. Практическое правило простое: не отправляйте закрытый код, токены, дампы production и персональные данные в free endpoint. Для коммерческого проекта запросите Data Processing Addendum, письменное подтверждение training opt-out, срок retention и место обработки.
Poolside endpoint не помечен как подтверждённый Zero Data Retention. OpenRouter хранит request metadata, а content logging у него выключен по умолчанию; это не отменяет политику upstream. Enterprise OpenRouter предлагает EU/US in-region routing по запросу, но публичного подтверждения, что оно распространяется на Laguna, нет.
Poolside не публикует список стран, Russia-specific доступность, регион hosted inference или способы оплаты по странам. Поэтому нельзя обещать работу из России. Если география и конфиденциальность критичны, предсказуемый путь — локальный или self-managed deployment после проверки возможности скачать веса и соблюдения лицензии.
Как выбрать модель под задачу
| Задача | Выбор | Почему |
|---|---|---|
| Локальный агент на Mac/рабочей станции | XS 2.1 | 33B-A3B, официальные кванты, 256K |
| Быстрые PR fixes, тесты, рефакторинг | XS 2.1 hosted или local | Дешевле и быстрее; качество проверяется на вашем harness |
| Длинный аудит большого monorepo | S 2.1 paid | 1M route и лучшее long-horizon поведение |
| Многошаговый coding research | S 2.1 max thinking | Самые сильные текущие результаты Laguna, но нужен большой timeout |
| Воспроизведение исследования апреля–мая | XS.2 или M.1 exact checkpoint | Совпадает с исходной моделью и sampling settings |
| Нативный анализ скриншотов | Не Laguna | Выберите multimodal Qwen/Devstral или добавьте отдельную vision-модель |
| Строгий ZDR/регулируемый код | Self-hosted Laguna или договорной deployment | Public hosted Poolside ZDR не подтверждён |
M.1 имеет смысл, если существующая система уже проверена именно на ней, нужна её base-модель для исследований или результаты лучше на вашей внутренней выборке. Выбирать её только потому, что 225B больше 118B, не стоит.
Интеграция с coding agent
Для прямого API используется OpenAI-compatible Chat Completions:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["POOLSIDE_API_KEY"],
base_url="https://inference.poolside.ai/v1",
)
response = client.chat.completions.create(
model="poolside/laguna-s-2.1",
messages=[
{"role": "system", "content": "Ты coding agent. Сначала изучи репозиторий, затем меняй файлы и проверяй тестами."},
{"role": "user", "content": "Найди причину гонки в checkout и подготовь минимальный патч."},
],
tools=[
{
"type": "function",
"function": {
"name": "shell",
"description": "Выполнить команду в изолированном checkout",
"parameters": {
"type": "object",
"properties": {"cmd": {"type": "string"}},
"required": ["cmd"],
},
},
}
],
stream=True,
)
Код только показывает форму запроса: tool executor, разрешения и возврат результатов нужно реализовать отдельно. Не давайте модели произвольный shell в production. Ограничьте workspace, network, secrets и destructive commands.
Для pool с собственным OpenAI-compatible endpoint используются POOLSIDE_STANDALONE_BASE_URL, POOLSIDE_STANDALONE_MODEL и POOLSIDE_API_KEY. Для редакторов агент можно подключать по ACP. OpenRouter и Vercel позволяют подставить свои base URL и model ID; не переносите :free между провайдерами автоматически.
Рабочие шаблоны промптов
Для исправления бага:
Цель: исправить <симптом> в <путь/модуль>.
Готово, когда: воспроизводящий тест падает до патча и проходит после него,
а существующий набор <команда> остаётся зелёным.
Ограничения: не менять публичный API, зависимости и несвязанные файлы.
Сначала найди data flow и покажи краткую гипотезу. Затем внеси минимальный патч,
запусти проверки и перечисли непроверенное.
Для аудита репозитория:
Проверь <контур> на <класс ошибок>. Не исправляй код.
Для каждой находки дай путь и строку, вход, опасный переход, наблюдаемый эффект,
условия воспроизведения и тест, который отличит реальную ошибку от гипотезы.
Игнорируй generated/vendor директории. Не делай вывод только по названию функции.
Для миграции:
Переведи <компонент> с <старое> на <новое>, сохранив <контракты>.
Работай этапами: инвентаризация зависимостей, совместимый слой, миграция вызовов,
удаление legacy только после тестов. После каждого этапа запускай <команды>.
Если документация и код расходятся, остановись и зафиксируй расхождение.
Laguna лучше работает, когда может проверить результат. «Сделай красиво» без файлов, тестов и definition of done хуже, чем короткий промпт с наблюдаемым критерием.
Воспроизводимый тест перед внедрением
Не пытайтесь повторить headline SWE-bench на пяти случайных задачах. Соберите свой небольшой набор, который отражает работу команды.
| ID | Тип | Задача | Автоматическая проверка |
|---|---|---|---|
| T1 | Bug fix | Реальная исправленная ошибка без merge commit в контексте | Новый regression test |
| T2 | Multi-file refactor | Изменение интерфейса через 3–5 модулей | Unit + typecheck |
| T3 | Terminal | Сборка проекта в чистом container | Exit code и артефакт |
| T4 | Codebase Q&A | Найти data flow через несколько пакетов | Список обязательных фактов/путей |
| T5 | Tool schema | Вызвать две функции с nested JSON | Валидный JSON и правильный порядок |
| T6 | Recovery | Дать заведомо неработающий первый путь | Агент меняет подход и завершает тест |
Зафиксируйте commit, container image, agent/harness version, tool schemas, permissions, model ID, quantization, context, thinking, temperature и лимит шагов. Делайте минимум три повтора на задачу. Для локальной модели сохраняйте hash checkpoint и runtime build.
Форма результата оставлена пустой специально:
| Модель/endpoint | Harness + версия | Thinking | T1 | T2 | T3 | T4 | T5 | T6 | Средняя цена | Медиана времени | Ошибки parser/loop | | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | | Laguna XS 2.1 | | | | | | | | | | | | | Laguna S 2.1 | | | | | | | | | | | | | Текущая production-модель | | | | | | | | | | | |
Помимо pass/fail считайте число невалидных tool calls, повторов одной команды, преждевременных заявлений «готово», объём reasoning/output и случаи изменения несвязанных файлов. Именно эти сбои определяют стоимость coding agent в production.
Вывод
Laguna в 2026 году — практичное семейство open-weight coding models, а не один загадочный «Poolside AI». XS 2.1 — лучший старт: локальные кванты, 256K и дешёвый hosted route. S 2.1 нужна, когда задача действительно длинная и сложная: она предлагает 1M-контекст, сильнее держит цель и стоит лишь немного дороже на токен. M.1 остаётся исследовательским и compatibility-вариантом; XS.2 — legacy.
Headline-бенчмарки подтверждают, что Poolside получила сильный результат для размеров моделей, но не заменяют проверку: оценки сняты в родном pool, с patched environments и несколькими попытками. Зафиксируйте harness, reasoning parser и checkpoint, прогоните свежие внутренние задачи, затем решайте между API и local deployment.
Hosted-вариант выигрывает ценой и простотой. Local/self-managed нужен, когда важны закрытый код, регион, фиксированный runtime или отсутствие доверия к неясному retention. Бесплатные endpoints подходят для прототипа на несекретных данных, а не для production-политики безопасности.
Автор статьи

Контент-менеджер AI-раздела
Отвечает за каталог нейросетей и AI-инструментов. Следит за обновлениями LLM-моделей, тестирует новые сервисы и ведёт раздел бесплатных инструментов.
Вопросы и ответы
Текущие checkpoints открыты по весам: XS.2 и M.1 — Apache 2.0, XS 2.1 и S 2.1 — OpenMDW-1.1. Hosted API остаётся отдельным сервисом со своими условиями. Open-weight не означает, что training data и весь training code опубликованы.
XS 2.1 — релиз 2 июля, который заменил апрельскую XS.2. Размер тот же, 33B-A3B, но post-training и результаты agentic tests обновлены, лицензия сменилась с Apache 2.0 на OpenMDW-1.1. Для нового проекта берите XS 2.1.
S 2.1 обучена позже на архитектуре второго поколения и получила новый post-training с длинными rollout budgets и agent reinforcement learning. Число параметров не учитывает качество данных, training recipe и test-time thinking.
Нет. Все Laguna — text-to-text. Агент может получить OCR или текст от отдельного vision-инструмента, но это составная система. Если изображения нужны напрямую, сравните мультимодальные Qwen3.6-35B-A3B и Devstral Small 2.
Официальный Q4/NVFP4-артефакт занимает около 20 GB, поэтому веса могут поместиться впритык. Runtime buffers и KV cache тоже требуют память, а полный 256K почти наверняка не поместится. Это сценарий для измерения с малым контекстом или CPU offload, не гарантированная конфигурация.
Да, на машинах с большой unified memory или несколькими GPU. Официальные кванты начинаются примерно от 66–96 GB файлов, Poolside показывает DGX Spark 128 GB как целевой пример. Скорость и доступный контекст сильно зависят от runtime, KV-cache и quantization.
Модель доступна через OpenAI-compatible API, а агрегаторы могут давать Responses или Anthropic Messages adapter. Poolside также перечисляет Cline, OpenCode, Kilo, Hermes, Pi и другие клиенты. Совместимость протокола не гарантирует качество tool calls: сначала прогоните nested JSON и длинную цепочку в точной версии клиента.
Для S 2.1 thinking даёт большой прирост в опубликованных Terminal-Bench и DeepSWE, но увеличивает задержку и output cost. Включайте max для сложного long-horizon задания, выключайте для короткой трансформации или массовой простой операции после собственного A/B-теста.
Нет. Бесплатность объявлена временной. OpenRouter ограничивает free-модели 20 запросами в минуту и 50 или 1 000 запросами в сутки в зависимости от купленных кредитов. Poolside не публикует числовой лимит прямого бесплатного ключа.
Публичные документы не дают подтверждённого ZDR, срок retention у Poolside указан как неизвестный, а описание free routes допускает обучение на input/output. Для секретного кода используйте local/self-managed deployment или договорной endpoint с DPA, training opt-out и сроком удаления.
Официального списка стран и Russia-specific обещания нет. Не планируйте production до проверки регистрации, оплаты и фактического запроса из нужной сети. Локальный checkpoint снимает зависимость от inference API, но не решает доступ к скачиванию и юридические ограничения.
На OpenRouter: до 32 768 токенов для XS 2.1 и бесплатной S 2.1, до 131 072 для платной S 2.1. Это provider-specific лимиты, а не свойство весов во всех runtime. Длинное reasoning тоже занимает completion budget.
Только после проверки harness, task version, patches, sampling и числа попыток. Poolside публикует подробные условия и траектории, но использует родной pool; у Qwen, Mistral и независимых leaderboard другие агенты. Для решения о внедрении важнее одинаковый тест на свежих внутренних задачах.




Комментарии(0)
Оставьте комментарий
Войдите, чтобы присоединиться к обсуждению