Poolside Laguna: версии, бенчмарки, цены и запуск
Нейросети / ИИ

Poolside Laguna: версии, бенчмарки, цены и запуск

Poolside Laguna — семейство текстовых моделей для программирующих агентов: они читают репозиторий через инструменты, меняют файлы, запускают команды и проверяют тесты.

Анастасия Петрова
Анастасия Петрова
Контент-менеджер AI-раздела18 мин

Poolside Laguna — семейство текстовых моделей для программирующих агентов: они читают репозиторий через инструменты, меняют файлы, запускают команды и проверяют тесты. На 6 сентября 2026 года разумный выбор сводится к двум моделям: Laguna XS 2.1 для быстрого и локального запуска и Laguna S 2.1 для сложных многошаговых задач. Более крупная Laguna M.1 всё ещё поддерживается и получила открытые веса, но S 2.1 новее, сильнее в актуальных тестах и активирует меньше параметров. Laguna XS.2 нужна в основном для воспроизводимости старых экспериментов: в прямом API её заменила XS 2.1.

Главное преимущество Laguna — открытые веса, длинный контекст и низкая цена hosted-версий. Главный риск — зависимость от агентской оболочки. Высокий результат в pool, родном агенте Poolside, не гарантирует такое же поведение в Cline, Claude Code-совместимой оболочке или самописном tool loop. Перед выбором нужно тестировать не чат, а свой репозиторий, свои инструменты и точную версию inference runtime. Для выбора оболочки и среды разработки полезно сравнить доступные ИИ-сервисы для программирования.

Цены, endpoint и доступность ниже проверены 6 сентября 2026 года. Бесплатные маршруты временные, скидки могут измениться.

Что такое Laguna и что ею не является

Poolside обучает Laguna как foundation models для software engineering. Все выпущенные модели — Mixture of Experts (MoE): в памяти хранятся все веса, но для каждого токена работает только часть экспертов. Обозначение 118B-A8B означает примерно 118 млрд параметров всего и около 8 млрд активных на токен. Это снижает вычислительную нагрузку, но не превращает 118B-модель в файл размером 8B.

У названий Poolside есть несколько уровней:

Название Что это Что не следует из названия
Laguna XS.2, XS 2.1, S 2.1, M.1 Конкретные модели и checkpoints Тариф, хост и агентская оболочка
pool Терминальный coding agent и клиент/сервер Agent Client Protocol (ACP) Отдельная модель
Shimmer Облачная среда для сборки веб-приложений, API и CLI Новая версия Laguna
chat.poolside.ai Веб-чат с поиском и базовым выполнением кода Нативное зрение или встроенный браузер в весах
Poolside API, OpenRouter, Vercel, Baseten Способы получить inference Новый checkpoint при каждом алиасе

Модальность у Laguna одна: текст на входе, текст на выходе. Она не видит скриншоты и не принимает аудио. Если агент открывает веб-страницу, читает файл или выполняет тест, это делает инструмент вокруг модели.

Все версии Laguna без путаницы в названиях

Текущая таблица Poolside включает Laguna S 2.1, XS 2.1 и M.1. История семейства содержит ещё XS.2.

Модель Дата релиза Параметры Контекст Hosted model ID Веса Текущий смысл
Laguna XS.2 28 апреля 2026; 256K с 26 мая 33B-A3B 262 144 poolside/laguna-xs.2 poolside/Laguna-XS.2, Apache 2.0 Предыдущая XS; direct API sunset объявлен в июле
Laguna M.1 28 апреля 2026; 256K с 26 мая 225B-A23B 262 144 poolside/laguna-m.1 poolside/Laguna-M.1, Apache 2.0 Крупная модель первого поколения, сейчас open-weight
Laguna XS 2.1 2 июля 2026 33B-A3B 262 144 poolside/laguna-xs-2.1 poolside/Laguna-XS-2.1, OpenMDW-1.1 Быстрая актуальная XS для local и API
Laguna S 2.1 21 июля 2026 118B-A8B до 1 048 576 poolside/laguna-s-2.1 poolside/Laguna-S-2.1, OpenMDW-1.1 Актуальная сильнейшая Laguna

Точка в XS.2 важна. XS 2.1 — не альтернативное написание того же имени, а новый post-trained checkpoint с более сильным multilingual coding, terminal-задачами и другой лицензией.

Laguna XS.2

XS.2 стала первым открытым релизом Poolside. В ней 40 слоёв: 10 с global attention и 30 со sliding-window attention, 256 routed experts плюс один shared expert, 33 млрд параметров всего и 3 млрд активных. В мае hosted-конфигурацию расширили до 256K.

Модель остаётся доступной как Apache 2.0 checkpoint, но 2 июля Poolside предупредила, что уберёт XS.2 из собственного API через неделю. Для нового проекта выбирать её незачем. Исключения — повтор старого теста, сохранённая интеграция или dedicated deployment в Baseten.

Laguna M.1

M.1 — 225B-A23B MoE из 70 слоёв. После трёх dense-слоёв идут 67 sparse MoE-слоёв с 256 экспертами и top-16 routing. При апрельском запуске Poolside предлагала веса M.1 организациям по запросу. Сейчас официальная коллекция M.1 открыта под Apache 2.0 и содержит post-trained, base, FP8 и NVFP4 варианты.

Дата модели от этого не меняется: M.1 выпущена 28 апреля. Коллекция помечена обновлением 21 июля, а отдельные репозитории — 14 июля. Публичного объявления, которое позволило бы точнее назвать день открытия весов, найти не удалось.

Laguna XS 2.1

XS 2.1 сохранила класс 33B-A3B и 256K, но получила обновлённый post-training. Poolside заявляет рост SWE-bench Multilingual с 57,7% до 63,1% и Terminal-Bench 2.0 с 35,7% до 37,5%.

Коллекция XS 2.1 содержит BF16, FP8, INT4, NVFP4, GGUF и отдельные DFlash speculator models. DFlash — малая draft-модель для speculative decoding, а не «Laguna XS 2.2» и не более умный checkpoint.

Laguna S 2.1

S 2.1 масштабирует второе поколение до 118B-A8B: 48 слоёв, 256 routed experts плюс один shared, 12 global-attention и 36 sliding-window слоёв. Полный контекст — 1 048 576 токенов. Карточка S 2.1 публикует BF16, FP8, INT4, NVFP4, GGUF, MLX и DFlash-варианты.

Это не просто промежуточный размер между XS и M. Новый post-training учит модель дольше держать цель, возвращаться после неудачного подхода и проверять результат. Poolside называет S 2.1 самой сильной моделью семейства, несмотря на меньший общий и активный размер относительно M.1.

Контекст, reasoning и tool use

У Laguna есть native reasoning с рассуждением до и между вызовами инструментов. Poolside называет режим thinking. Для агентского цикла важны три детали.

Первая — сохранять прошлое рассуждение. Если клиент получает reasoning_content или reasoning_details, но при следующем запросе возвращает только финальный текст, модель может перестать корректно рассуждать после tool call.

Вторая — не путать длину контекста и длину ответа. Контекст включает промпт, историю, tool results, reasoning и завершение. На OpenRouter платная S 2.1 допускает 1 048 576 токенов суммарного контекста и до 131 072 completion tokens; бесплатная S и обе XS-маршрута — 262 144 и до 32 768. Это ограничения конкретного провайдера. Poolside не публикует универсальный max output для прямого API.

Третья — проверять tool parser. В API доступны tools и автоматический выбор инструмента, но единственный текущий OpenRouter endpoint не обещает принудительные режимы required и выбор конкретной функции. У S 2.1 есть известная склонность запоминать формат родного harness и ошибаться в похожей схеме стороннего агента. Poolside также отмечает некорректное экранирование вложенных JSON-массивов в некоторых tool calls. Читать полный обзор сервиса OpenRouter.

Возможность XS.2 M.1 XS 2.1 S 2.1
Text input/output Да Да Да Да
Изображения, аудио, видео Нет Нет Нет Нет
Interleaved thinking Да Да Да Да
Thinking on/off Да Да Да Да
Low/medium/high effort Не заявлено Не заявлено Не заявлено Нет, только off/max
Tool calling Да, через совместимый harness Да Да Да
Предпочтительный агент pool или проверенный OpenAI-compatible loop pool pool pool; сторонний harness тестировать отдельно

Что показывают бенчмарки

Числа ниже полезны для предварительного выбора, но это результаты Poolside, а не единая независимая лига. M.1 и XS.2 опубликованы в техническом отчёте 25 мая; XS 2.1 — в релизе 2 июля.

Модель Дата таблицы SWE-bench Verified SWE-bench Multilingual SWE-Bench Pro public Terminal-Bench 2.0
Laguna XS.2 25 мая 2026 69,9% 57,7% 46,3% 35,7%
Laguna M.1 25 мая 2026 74,6% 63,1% 49,2% 45,8%
Laguna XS 2.1 2 июля 2026 70,9% 63,1% 47,6% 37,5%

Для S 2.1 Poolside перешла на часть более новых тестов, поэтому честнее держать отдельную таблицу.

Тест Версия/срез Laguna S 2.1 Условия публикации
Terminal-Bench 2.1, 21 июля 2026 70,2% max thinking; 60,4% без thinking
SWE-bench Multilingual срез Poolside, 21 июля 78,5% pool, до 500 шагов
SWE-Bench Pro public dataset, 21 июля 59,4% pool, patched images/verifiers
DeepSWE leaderboard-era срез, 21 июля 40,4% max thinking; 16,5% без thinking
SWE Atlas Codebase Q&A, 21 июля 46,2% три попытки на задачу
Toolathlon Verified, карточка дополнена 2 сентября 49,7% три попытки на задачу

Почему цифры нельзя читать как турнирную таблицу моделей

Poolside запускала Laguna через Laude Harbor со своим агентом pool, максимумом 500 шагов и sandbox. Для большинства тестов считался средний pass@1 по нескольким попыткам. Terminal-Bench получал больше CPU и RAM, чем остальные задачи. Часть базовых образов и verifier была исправлена из-за инфраструктурных сбоев.

Сравнительные столбцы в релизах собраны из максимального доступного результата конкурента: собственного отчёта вендора, официального leaderboard или Artificial Analysis. Harness у моделей мог отличаться. В DeepSWE Poolside прямо сопоставляет свой pool с результатами, часто полученными в mini-swe-agent.

Есть и риск contamination: задачи SWE-bench публичны, а post-training coding-модели использует историю открытых репозиториев. Poolside проверяла reward hacking и публикует траектории S 2.1, но это не доказывает, что модель никогда не видела близкий паттерн задачи.

На проверенной официальной SWE-bench leaderboard отдельного воспроизведения Laguna в унифицированном bash-only mini-SWE-agent не было. Artificial Analysis запускает Terminal-Bench 2.1 через Terminus 2 и три повтора — это другой harness. Поэтому корректная формулировка: «Poolside сообщает 70,2%», а не «независимый тест доказал лидерство».

Laguna против близких альтернатив

Эта матрица не пытается назвать абсолютного победителя. Она показывает, когда ограничение Laguna меняет выбор.

Модель Размер Контекст Модальности Открытые веса Проверенная API-цена input/output за 1M Причина выбрать
Laguna XS 2.1 33B-A3B 256K Text OpenMDW-1.1 OpenRouter $0,06/$0,12 Быстрый local coding agent, дешёвый output, 36–64 GB unified RAM
Qwen3.6-35B-A3B 35B-A3B 256K native, расширяемый Text + vision Open weights OpenRouter $0,05/$0,70 Нужны скриншоты/изображения или лучший результат в таблице Qwen: 73,4% SWE Verified и 51,5% Terminal 2.0
Devstral Small 2 24B dense 256K Text + image Apache 2.0 Mistral $0,10/$0,30 Нужен vision, простой dense deployment и привычный Mistral/Vibe stack
Laguna S 2.1 118B-A8B до 1M Text OpenMDW-1.1 OpenRouter $0,09/$0,18 Нужен сильный text-only agent, длинная trajectory и есть 66–192+ GB memory либо hosted API
DeepSeek V4 Flash 284B-A13B 1M hosted Text; vision — отдельный experimental ID Open weights Текущая цена не зафиксирована Нужен альтернативный 1M-provider; локально заметно тяжелее XS/S

Qwen и Mistral тоже публикуют результаты в собственных scaffold. Даже одинаковая надпись SWE-bench Pro не гарантирует одинаковые task patches и бюджет. Для выбора между XS 2.1 и Qwen3.6 лучше один раз прогнать одинаковый агент и свежие задачи, чем вычитать два процента из разных пресс-релизов.

Где запускать Laguna в 2026 году

Poolside API напрямую

Прямой base URL — https://inference.poolside.ai/v1. API Poolside предоставляет OpenAI-compatible GET /v1/models и POST /v1/chat/completions. Для нового проекта model ID нужно брать из /v1/models после получения ключа: доступ может зависеть от аккаунта.

Публичные материалы называют бесплатный ограниченный доступ и платные endpoints, но полного текущего тарифа, числовых rate limits, SLA и max output по каждой модели на странице API нет. У M.1 особенно важно не строить production-план на словах «free for a limited time».

OpenRouter

OpenRouter удобен для сравнения в одном OpenAI-compatible endpoint. На 6 сентября у Laguna два активных семейства и один провайдер за каждым маршрутом — Poolside.

OpenRouter ID Контекст Max output Input / 1M Output / 1M Cache read / 1M
poolside/laguna-xs-2.1 262 144 32 768 $0,06 $0,12 $0,03
poolside/laguna-xs-2.1:free 262 144 32 768 $0 $0 Не заявлен
poolside/laguna-s-2.1 1 048 576 131 072 $0,09 $0,18 $0,009
poolside/laguna-s-2.1:free 262 144 32 768 $0 $0 Не заявлен
poolside/laguna-m.1 В каталоге, но 0 endpoints — — — —

Это текущие скидочные цены каталога Poolside в OpenRouter. В релизах Poolside указаны list prices: XS 2.1 — $0,10/$0,20/$0,05, S 2.1 — $0,10/$0,20/$0,01. Не переносите скидку OpenRouter на прямой счёт Poolside.

Общие лимиты :free: 20 запросов в минуту и 50 в сутки, если за всё время куплено меньше $10 кредитов; после покупки не менее $10 — 1 000 бесплатных запросов в сутки. Upstream capacity может урезать доступ дополнительно.

Vercel AI Gateway

Vercel AI Gateway предоставляет S 2.1 как poolside/laguna-s-2.1 с 1M и poolside/laguna-s-2.1-free с 256K. Обратите внимание на -free: это не OpenRouter ID с :free. Платная цена — $0,10 input и $0,20 output за 1M. Маршрут удобен проектам на AI SDK, но фактический inference всё равно выполняет Poolside. Читать полный обзор сервиса Vercel.

Baseten и NVIDIA NIM

Baseten Model Library предлагает deployable S 2.1, XS 2.1, M.1 и legacy XS.2. После deployment пользователь получает свой base URL и вызывает OpenAI-compatible API. Публичная карточка не показала универсальный serverless тариф: стоимость зависит от конфигурации и времени GPU.

NVIDIA NIM содержит XS 2.1 с ID poolside/laguna-xs-2.1. Playground/prototype требует аккаунт и ключ. Публичной production-цены в карточке нет.

Together и Fireworks встречаются в общих списках inference-платформ, но текущего официального Laguna endpoint у них найти не удалось. Наличие сервиса не означает наличие этой модели.

Локальный запуск

Для local-first сценария выбирайте официальные Hugging Face checkpoints или Ollama library. Основные runtime:

  • Ollama/MLX — простой старт на Apple Silicon;
  • llama.cpp — GGUF и CPU/GPU offload, но сверяйте поддержку Laguna и chat template в конкретном build;
  • vLLM — OpenAI-compatible сервер на NVIDIA и других поддерживаемых ускорителях;
  • SGLang — альтернативный высокопроизводительный server;
  • TensorRT-LLM — NVIDIA deployment, где критична совместимая pre-release/stable версия;
  • Transformers — исследования и проверка checkpoint; крупные варианты удобнее обслуживать через inference engine.

Официальные карточки указывают poolside_v1 reasoning/tool parser для vLLM и SGLang. На старых builds parser мог пропускать tool calls или не отделять reasoning. Сначала зафиксируйте версию runtime, затем проверяйте один tool call и многошаговую цепочку.

Сколько памяти нужно локально

Есть два разных ответа: размер весов для домашнего запуска и консервативный planning estimate Poolside для поддерживаемого enterprise inference.

Модель Доступные официальные ориентиры Практический вывод
XS 2.1 Mac с 36 GB RAM; Ollama Q4/NVFP4 около 20 GB, Q8 36 GB, BF16 67–68 GB; Poolside FP8 planning 96 GB 36–64 GB unified/system memory — разумная локальная зона; 24 GB GPU может вместить узкий 4-bit вариант, но это inference, а не гарантия полного 256K
S 2.1 BF16 weights около 236 GB; Ollama NVFP4 MLX около 66 GB, Q4 около 96 GB; FP8 planning 192 GB; заявлен запуск на DGX Spark 128 GB Для серьёзного local agent лучше 96–128+ GB; 1M context требует дополнительной KV memory
M.1 FP8 planning 384 GB; BF16 — крупный multi-GPU checkpoint Датацентр или dedicated deployment; consumer single-GPU нецелесообразен

Planning table Poolside не является минимальным требованием. Она учитывает поддерживаемую конфигурацию, но не фиксирует concurrency, batch и длину контекста. Для Kubernetes компания советует ориентироваться минимум на 8 CPU cores на GPU и host RAM не меньше суммарной GPU memory.

Файл Q4 размером 20 GB не означает, что модель с 256K заработает в 20 GB: нужны runtime buffers и KV cache. Чем длиннее история и больше параллельных агентов, тем выше расход.

Цена типовых задач

Расчёты используют скидочные цены OpenRouter на 6 сентября. Один «запрос агента» обычно состоит из многих API calls, поэтому итоговый счёт — сумма всей траектории.

Сценарий XS 2.1 S 2.1 Комментарий
50K input + 10K output $0,0042 $0,0063 Короткий анализ или исправление
500K input + 100K output Не помещается в один 256K request $0,063 Требуется платная S с 1M
200K cache read + 30K нового input + 20K output $0,0102 $0,0081 У S очень дешёвый cache-read
400K cache read + 100K нового input + 50K output Не помещается в один XS request $0,0216 Сценарий длинной S-сессии

Reasoning часто тарифицируется как output. Модель с max thinking может оказаться дороже простой формулы «текст ответа × цена»: считайте usage всего completion, а не только видимый финал.

Hosted Laguna дёшева настолько, что локальный сервер редко окупается только токенами. Self-hosting выбирают ради приватности, фиксированной доступности, экспериментальных checkpoints, контроля latency или постоянной высокой загрузки.

Приватность, ZDR и доступ из регионов

Privacy Policy Poolside допускает использование данных для улучшения сервисов и обучения моделей, если пользователь не отказался, и не называет фиксированный срок хранения API prompts. OpenRouter в общей таблице провайдеров помечает Poolside как «не обучает на prompts», но срок хранения считает неизвестным. Описание бесплатных Laguna в каталоге отдельно предупреждает, что input/output бесплатных запросов могут использоваться для обучения.

Публичные формулировки конфликтуют. Практическое правило простое: не отправляйте закрытый код, токены, дампы production и персональные данные в free endpoint. Для коммерческого проекта запросите Data Processing Addendum, письменное подтверждение training opt-out, срок retention и место обработки.

Poolside endpoint не помечен как подтверждённый Zero Data Retention. OpenRouter хранит request metadata, а content logging у него выключен по умолчанию; это не отменяет политику upstream. Enterprise OpenRouter предлагает EU/US in-region routing по запросу, но публичного подтверждения, что оно распространяется на Laguna, нет.

Poolside не публикует список стран, Russia-specific доступность, регион hosted inference или способы оплаты по странам. Поэтому нельзя обещать работу из России. Если география и конфиденциальность критичны, предсказуемый путь — локальный или self-managed deployment после проверки возможности скачать веса и соблюдения лицензии.

Как выбрать модель под задачу

Задача Выбор Почему
Локальный агент на Mac/рабочей станции XS 2.1 33B-A3B, официальные кванты, 256K
Быстрые PR fixes, тесты, рефакторинг XS 2.1 hosted или local Дешевле и быстрее; качество проверяется на вашем harness
Длинный аудит большого monorepo S 2.1 paid 1M route и лучшее long-horizon поведение
Многошаговый coding research S 2.1 max thinking Самые сильные текущие результаты Laguna, но нужен большой timeout
Воспроизведение исследования апреля–мая XS.2 или M.1 exact checkpoint Совпадает с исходной моделью и sampling settings
Нативный анализ скриншотов Не Laguna Выберите multimodal Qwen/Devstral или добавьте отдельную vision-модель
Строгий ZDR/регулируемый код Self-hosted Laguna или договорной deployment Public hosted Poolside ZDR не подтверждён

M.1 имеет смысл, если существующая система уже проверена именно на ней, нужна её base-модель для исследований или результаты лучше на вашей внутренней выборке. Выбирать её только потому, что 225B больше 118B, не стоит.

Интеграция с coding agent

Для прямого API используется OpenAI-compatible Chat Completions:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["POOLSIDE_API_KEY"],
    base_url="https://inference.poolside.ai/v1",
)

response = client.chat.completions.create(
    model="poolside/laguna-s-2.1",
    messages=[
        {"role": "system", "content": "Ты coding agent. Сначала изучи репозиторий, затем меняй файлы и проверяй тестами."},
        {"role": "user", "content": "Найди причину гонки в checkout и подготовь минимальный патч."},
    ],
    tools=[
        {
            "type": "function",
            "function": {
                "name": "shell",
                "description": "Выполнить команду в изолированном checkout",
                "parameters": {
                    "type": "object",
                    "properties": {"cmd": {"type": "string"}},
                    "required": ["cmd"],
                },
            },
        }
    ],
    stream=True,
)

Код только показывает форму запроса: tool executor, разрешения и возврат результатов нужно реализовать отдельно. Не давайте модели произвольный shell в production. Ограничьте workspace, network, secrets и destructive commands.

Для pool с собственным OpenAI-compatible endpoint используются POOLSIDE_STANDALONE_BASE_URL, POOLSIDE_STANDALONE_MODEL и POOLSIDE_API_KEY. Для редакторов агент можно подключать по ACP. OpenRouter и Vercel позволяют подставить свои base URL и model ID; не переносите :free между провайдерами автоматически.

Рабочие шаблоны промптов

Для исправления бага:

Цель: исправить <симптом> в <путь/модуль>.
Готово, когда: воспроизводящий тест падает до патча и проходит после него,
а существующий набор <команда> остаётся зелёным.
Ограничения: не менять публичный API, зависимости и несвязанные файлы.
Сначала найди data flow и покажи краткую гипотезу. Затем внеси минимальный патч,
запусти проверки и перечисли непроверенное.

Для аудита репозитория:

Проверь <контур> на <класс ошибок>. Не исправляй код.
Для каждой находки дай путь и строку, вход, опасный переход, наблюдаемый эффект,
условия воспроизведения и тест, который отличит реальную ошибку от гипотезы.
Игнорируй generated/vendor директории. Не делай вывод только по названию функции.

Для миграции:

Переведи <компонент> с <старое> на <новое>, сохранив <контракты>.
Работай этапами: инвентаризация зависимостей, совместимый слой, миграция вызовов,
удаление legacy только после тестов. После каждого этапа запускай <команды>.
Если документация и код расходятся, остановись и зафиксируй расхождение.

Laguna лучше работает, когда может проверить результат. «Сделай красиво» без файлов, тестов и definition of done хуже, чем короткий промпт с наблюдаемым критерием.

Воспроизводимый тест перед внедрением

Не пытайтесь повторить headline SWE-bench на пяти случайных задачах. Соберите свой небольшой набор, который отражает работу команды.

ID Тип Задача Автоматическая проверка
T1 Bug fix Реальная исправленная ошибка без merge commit в контексте Новый regression test
T2 Multi-file refactor Изменение интерфейса через 3–5 модулей Unit + typecheck
T3 Terminal Сборка проекта в чистом container Exit code и артефакт
T4 Codebase Q&A Найти data flow через несколько пакетов Список обязательных фактов/путей
T5 Tool schema Вызвать две функции с nested JSON Валидный JSON и правильный порядок
T6 Recovery Дать заведомо неработающий первый путь Агент меняет подход и завершает тест

Зафиксируйте commit, container image, agent/harness version, tool schemas, permissions, model ID, quantization, context, thinking, temperature и лимит шагов. Делайте минимум три повтора на задачу. Для локальной модели сохраняйте hash checkpoint и runtime build.

Форма результата оставлена пустой специально:

| Модель/endpoint | Harness + версия | Thinking | T1 | T2 | T3 | T4 | T5 | T6 | Средняя цена | Медиана времени | Ошибки parser/loop | | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | | Laguna XS 2.1 | | | | | | | | | | | | | Laguna S 2.1 | | | | | | | | | | | | | Текущая production-модель | | | | | | | | | | | |

Помимо pass/fail считайте число невалидных tool calls, повторов одной команды, преждевременных заявлений «готово», объём reasoning/output и случаи изменения несвязанных файлов. Именно эти сбои определяют стоимость coding agent в production.

Вывод

Laguna в 2026 году — практичное семейство open-weight coding models, а не один загадочный «Poolside AI». XS 2.1 — лучший старт: локальные кванты, 256K и дешёвый hosted route. S 2.1 нужна, когда задача действительно длинная и сложная: она предлагает 1M-контекст, сильнее держит цель и стоит лишь немного дороже на токен. M.1 остаётся исследовательским и compatibility-вариантом; XS.2 — legacy.

Headline-бенчмарки подтверждают, что Poolside получила сильный результат для размеров моделей, но не заменяют проверку: оценки сняты в родном pool, с patched environments и несколькими попытками. Зафиксируйте harness, reasoning parser и checkpoint, прогоните свежие внутренние задачи, затем решайте между API и local deployment.

Hosted-вариант выигрывает ценой и простотой. Local/self-managed нужен, когда важны закрытый код, регион, фиксированный runtime или отсутствие доверия к неясному retention. Бесплатные endpoints подходят для прототипа на несекретных данных, а не для production-политики безопасности.

Автор статьи

Анастасия Петрова — Контент-менеджер AI-раздела
Анастасия Петрова

Контент-менеджер AI-раздела

Отвечает за каталог нейросетей и AI-инструментов. Следит за обновлениями LLM-моделей, тестирует новые сервисы и ведёт раздел бесплатных инструментов.

Вопросы и ответы

Текущие checkpoints открыты по весам: XS.2 и M.1 — Apache 2.0, XS 2.1 и S 2.1 — OpenMDW-1.1. Hosted API остаётся отдельным сервисом со своими условиями. Open-weight не означает, что training data и весь training code опубликованы.

XS 2.1 — релиз 2 июля, который заменил апрельскую XS.2. Размер тот же, 33B-A3B, но post-training и результаты agentic tests обновлены, лицензия сменилась с Apache 2.0 на OpenMDW-1.1. Для нового проекта берите XS 2.1.

S 2.1 обучена позже на архитектуре второго поколения и получила новый post-training с длинными rollout budgets и agent reinforcement learning. Число параметров не учитывает качество данных, training recipe и test-time thinking.

Нет. Все Laguna — text-to-text. Агент может получить OCR или текст от отдельного vision-инструмента, но это составная система. Если изображения нужны напрямую, сравните мультимодальные Qwen3.6-35B-A3B и Devstral Small 2.

Официальный Q4/NVFP4-артефакт занимает около 20 GB, поэтому веса могут поместиться впритык. Runtime buffers и KV cache тоже требуют память, а полный 256K почти наверняка не поместится. Это сценарий для измерения с малым контекстом или CPU offload, не гарантированная конфигурация.

Да, на машинах с большой unified memory или несколькими GPU. Официальные кванты начинаются примерно от 66–96 GB файлов, Poolside показывает DGX Spark 128 GB как целевой пример. Скорость и доступный контекст сильно зависят от runtime, KV-cache и quantization.

Модель доступна через OpenAI-compatible API, а агрегаторы могут давать Responses или Anthropic Messages adapter. Poolside также перечисляет Cline, OpenCode, Kilo, Hermes, Pi и другие клиенты. Совместимость протокола не гарантирует качество tool calls: сначала прогоните nested JSON и длинную цепочку в точной версии клиента.

Для S 2.1 thinking даёт большой прирост в опубликованных Terminal-Bench и DeepSWE, но увеличивает задержку и output cost. Включайте max для сложного long-horizon задания, выключайте для короткой трансформации или массовой простой операции после собственного A/B-теста.

Нет. Бесплатность объявлена временной. OpenRouter ограничивает free-модели 20 запросами в минуту и 50 или 1 000 запросами в сутки в зависимости от купленных кредитов. Poolside не публикует числовой лимит прямого бесплатного ключа.

Публичные документы не дают подтверждённого ZDR, срок retention у Poolside указан как неизвестный, а описание free routes допускает обучение на input/output. Для секретного кода используйте local/self-managed deployment или договорной endpoint с DPA, training opt-out и сроком удаления.

Официального списка стран и Russia-specific обещания нет. Не планируйте production до проверки регистрации, оплаты и фактического запроса из нужной сети. Локальный checkpoint снимает зависимость от inference API, но не решает доступ к скачиванию и юридические ограничения.

На OpenRouter: до 32 768 токенов для XS 2.1 и бесплатной S 2.1, до 131 072 для платной S 2.1. Это provider-specific лимиты, а не свойство весов во всех runtime. Длинное reasoning тоже занимает completion budget.

Только после проверки harness, task version, patches, sampling и числа попыток. Poolside публикует подробные условия и траектории, но использует родной pool; у Qwen, Mistral и независимых leaderboard другие агенты. Для решения о внедрении важнее одинаковый тест на свежих внутренних задачах.

Смотрите также

Поделиться

Комментарии(0)

Оставьте комментарий

Войдите, чтобы присоединиться к обсуждению