Опубликовано: 9 июля 2026 г.

Cognition выпустила SWE-1.7 для Devin

Cognition представила SWE-1.7 - модель для агентного программирования в Devin. Разбираем обучение поверх Kimi K2.7, бенчмарки, self-compaction, доступ и практические ограничения.

Cognition выпустила SWE-1.7 для Devin

Cognition выпустила SWE-1.7 - новую модель для агентного программирования в Devin. Релиз опубликован 8 июля 2026 года. Компания называет SWE-1.7 самой сильной моделью, которую она обучала, и делает акцент не на универсальном чате, а на длинных инженерных задачах внутри агентной среды.

Это важное уточнение: SWE-1.7 не выглядит как модель для самостоятельного использования через публичный chat API. Она встроена в Devin Web, Devin Desktop и Devin CLI, где модель читает репозиторий, запускает команды, работает через терминал и возвращается к задаче после промежуточных проверок. Поэтому новость лучше оценивать через призму agentic coding, а не через обычные LLM-таблицы.

Как обучали SWE-1.7

Cognition пишет, что модель обучали поверх Kimi K2.7 с дополнительным reinforcement learning в Devin harness. Для компании это аргумент против идеи, что после сильного post-training базовой модели дальнейший RL быстро упирается в потолок. По их словам, собственный training pipeline дал заметный прирост поверх уже дообученной базы.

В релизе выделены четыре ключевых компонента: стабилизация длинных RL-прогонов, multi-cluster training, фильтрация данных и self-compaction. Последнее особенно важно для реальных задач разработки. Когда агент приближается к лимиту контекста, он учится писать краткое состояние работы и продолжать задачу из этой выжимки. В training run rollouts доходили до шести часов, но это не означает раскрытый context window в токенах: речь именно о длинном горизонте выполнения задачи.

Инфраструктурно Cognition описывает обучение на кластерах в четырех дата-центрах и на трех континентах. Весовые обновления передавались через object storage в виде сжатых дельт, чтобы rollout-инференс не зависел от одного большого кластера. Это техническая часть релиза, но она объясняет, почему компания отдельно говорит о снижении стоимости frontier RL.

Что показали бенчмарки

В анонсе опубликованы три основных результата SWE-1.7, все в формате pass rate:

  • FrontierCode 1.1 Main: 42,3%;
  • Terminal-Bench 2.1: 81,5%;
  • SWE-Bench Multilingual: 77,8%.

Для сравнения, SWE-1.6 на тех же строках набирала 9,4%, 39,7% и 58,3%. Прирост особенно заметен на FrontierCode и Terminal-Bench. При этом в таблице Cognition Opus 4.8 выше SWE-1.7 на всех трех наборах, а GPT 5.5 близок или выше на части строк. Поэтому корректная формулировка такая: SWE-1.7 серьезно усиливает Devin и подтягивает cost-performance, но не является абсолютным лидером во всех опубликованных тестах.

Поведение модели

Самая полезная часть релиза - не только цифры, но и описание поведения. Cognition отмечает, что SWE-1.7 чаще исследует кодовую базу перед правками: больше читает файлы, использует поиск, запускает небольшие проверки и пытается понять корень проблемы. Для багфиксов это плюс: пользователь часто описывает симптом, а причина может лежать в другом слое системы.

Есть и обратная сторона. Более тщательное исследование может расширять scope изменений: модель иногда трогает больше файлов и добавляет больше тестов, чем минимально нужно для задачи. Для production-работы это не минус сам по себе, но обязательный повод смотреть diff внимательнее. Хорошая агентная модель должна не только находить корень проблемы, но и удерживать границы правки.

Доступ и цена

SWE-1.7 доступна в Devin Web, Devin Desktop и Devin CLI. В документации Devin указано, что обычная SWE-1.7 доступна как free preview до 8 августа 2026 года. Также есть SWE-1.7 Lightning - версия на Cerebras с той же intelligence и меньшей задержкой; в блоге Cognition заявлена скорость до 1000 TPS.

Публичной цены за 1 млн input/output токенов для обычной SWE-1.7 Cognition не раскрыла. Devin отправляет пользователей смотреть актуальную стоимость в model selector, а newer enterprise plans считает через ACU. Поэтому в карточке LLM цена не должна заменяться оценкой из обсуждений: корректнее оставить ее как нераскрытую.

Кому смотреть

SWE-1.7 интересна командам, которые уже работают с Devin или оценивают агентные IDE/CLI для разработки. Модель стоит проверять на задачах с большим репозиторием, терминалом, тестами и многошаговой проверкой. Для коротких prompt-to-code примеров или локального self-hosting это не лучший кандидат: открытых весов и отдельного публичного endpoint для модели Cognition не дала.

Подробная карточка модели: SWE-1.7 в каталоге LLM. Источники: релиз Cognition и документация Devin по моделям.

Поделиться

Обсудить с ИИ

Комментарии(0)

Оставьте комментарий

Войдите, чтобы присоединиться к обсуждению

Читайте также