
Grok 4.6 vs GPT-5.6 Sol vs Claude Opus 5 vs Kimi K3
Универсального победителя в этой четверке нет. Для сложной работы через API разумная стартовая точка — GPT-5.6 Sol: у него контекст 1,05 млн токенов и широкий набор встроенных инструментов. Grok 4.6 стоит проверить первым, если важна цена API и хватает окна 500k.

Универсального победителя в этой четверке нет. Для сложной работы через API разумная стартовая точка — GPT-5.6 Sol: у него контекст 1,05 млн токенов и широкий набор встроенных инструментов. Grok 4.6 стоит проверить первым, если важна цена API и хватает окна 500k. Claude Opus 5 рассчитан на сложные долгие агентные задачи, где дополнительное качество может оправдать более дорогой вывод. Kimi K3 выделяется открытыми весами и подходит командам, которым нужны самостоятельное размещение и контроль инфраструктуры. Итоговый выбор определяет связка «модель + agent harness», поэтому одного места в лидерборде недостаточно.
Характеристики и цены ниже актуальны на 6 сентября 2026 года. Цена указана в долларах за 1 млн токенов для прямого API. Подписки чат-приложений, агрегаторы и облачные наценки в сравнение не входят.
Сравнение Grok 4.6, GPT-5.6 Sol, Claude Opus 5 и Kimi K3
| Модель | ID в API | Контекст | Reasoning effort | Цена input / cached input / output | Открытые веса | Когда проверять первой |
|---|---|---|---|---|---|---|
| Grok 4.6 | grok-4.6 |
500 000 | low, medium, high, xhigh | $2 / $0,50 / $6 при промпте <200k | Нет | Массовые агентные прогоны, код, веб-поиск и работа с X при жестком бюджете |
| GPT-5.6 Sol | gpt-5.6-sol; алиас gpt-5.6 |
1 050 000 | none, low, medium, high, xhigh, max | $4 / $0,40 / $20 | Нет | Сложная профессиональная работа, длинный контекст, широкий набор инструментов Responses API |
| Claude Opus 5 | claude-opus-5 |
1 000 000 | adaptive thinking, default high | $5 / — / $25 | Нет | Долгие агентные задачи, крупные изменения в коде, документы и работа, где ошибка дорога |
| Kimi K3 | kimi-k3 |
1 048 576 | low, high, max | $3 / $0,30 / $15 | Да, по лицензии Kimi K3 | Self-hosting, data residency, большие репозитории и эксперименты со своим harness |
Тарифы требуют пояснений. У Grok 4.6 запросы с промптом от 200k токенов оплачиваются по удвоенной ставке, а fast-вариант стоит вдвое дороже базового. У GPT-5.6 Sol цена на странице модели обозначена как промо как минимум до 21 ноября 2026 года; при входе свыше 272k весь запрос получает коэффициент 2x для input и 1,5x для output. У Claude Opus 5 thinking-токены входят в оплачиваемый output. Для Kimi K3 дешевый cached input полезен только при реальном попадании в кеш.
Цена миллиона токенов не равна цене завершенной задачи. Агент может сделать больше ходов, повторить неудачный вызов инструмента, перечитать репозиторий или потребовать долгой проверки человеком. Для бюджета важнее cost per accepted result: стоимость всех удачных и неудачных попыток до принятого результата.
Что представляет собой каждая модель
Grok 4.6
Grok 4.6 — закрытая модель xAI для кода, агентных сценариев и knowledge work. Она принимает текст и изображения, вызывает функции, использует веб-поиск, поиск по X и среду исполнения кода. Доступны Responses API и Chat Completions. Читать полный обзор сервиса Grok
Окно 500k меньше, чем у трех остальных участников. Этого достаточно для многих репозиториев, если harness выбирает релевантные файлы и вовремя сжимает историю. Загрузка всего проекта без отбора повышает стоимость и добавляет шум. В долгих циклах xAI рекомендует закреплять разговор за одним сервером через cache key и применять context compaction.
Главная практическая причина включить Grok 4.6 в пилот — низкая базовая цена: $2 за input и $6 за output. Экономия подтвердится только после полного прогона. Если модель делает больше шагов или чаще исправляет свои действия, итоговая задача может стоить дороже, чем предполагает прайс.
xAI показывает сильные результаты на CursorBench, FrontierCode и агентных оценках и описывает успешные длинные проекты с самопроверкой. Это данные разработчика модели. Они подтверждают, какие сценарии xAI считает целевыми, но не заменяют независимый прогон команды.
GPT-5.6 Sol
GPT-5.6 Sol — флагман семейства GPT-5.6 для сложной профессиональной работы. Важно сохранить точное имя: запрос к gpt-5.6-sol или алиасу gpt-5.6 относится к Sol, а GPT-5.6 Terra и Luna имеют другие роли и цены.
Модель поддерживает текст и изображения на входе, выдает текст, работает с function calling и structured outputs. В Responses API ей доступны web search, file search, code interpreter, hosted shell, apply patch, computer use, MCP, skills и tool search. Такой набор сокращает объем собственной интеграции, когда продукту нужны поиск, файлы, терминал и внешние MCP-сервисы в одном цикле.
Контекст 1,05 млн токенов и ответ до 128k подходят для больших кодовых баз, длинных документов и многошаговых задач. Большое окно не освобождает от управления контекстом: устаревшие планы, повторные логи и нерелевантные файлы способны вытеснить нужные ограничения. Reasoning effort лучше фиксировать явно. Уровень max увеличивает вычисления и расход output-токенов; он оправдан, когда собственный eval показывает измеримый прирост.
GPT-5.6 Sol удобен как базовый кандидат для нового сложного workflow: широкая tool surface, длинный контекст и несколько уровней reasoning позволяют построить одну конфигурацию и затем измерять цену и качество. Fine-tuning для этой модели не поддерживается, поэтому адаптация строится на инструкциях, инструментах, retrieval, evals и логике harness.
Claude Opus 5
Claude Opus 5 — закрытая модель Anthropic для complex agentic coding и enterprise work. Контекст составляет 1 млн токенов, максимальный ответ — 128k. Adaptive thinking включен по умолчанию, а базовый effort равен high. Читать полный обзор сервиса Claude
Anthropic выделяет long-horizon задачи, глубокий анализ, крупные изменения в репозитории, code review, computer use, таблицы, презентации и визуальную проверку интерфейсов. В релизных материалах Opus 5 лидирует на Frontier-Bench v0.1 и показывает высокую эффективность на CursorBench, AutomationBench и OSWorld. Эти результаты опубликованы самим разработчиком. Полезный вывод из них — набор целевых сценариев для пилота, а не готовый универсальный рейтинг.
Opus 5 стоит $5 за input и $25 за output. Thinking-токены оплачиваются как output, поэтому одинаковая длина видимого ответа не гарантирует одинаковый счет. Уровни low и medium стоит проверить на простых классах задач, а xhigh — на редких сложных задачах, где прирост приемки покрывает цену и задержку.
Модель особенно интересна командам, которым нужна длительная автономная работа с проверками. При этом надежность определяет и обвязка: доступные инструменты, правила остановки, обработка ошибок, разрешения и качество обратной связи после тестов.
Kimi K3
Kimi K3 — открытая multimodal Mixture-of-Experts-модель Moonshot AI: 2,8 трлн параметров всего и 104 млрд активных параметров на токен. Контекст равен 1 048 576 токенам. Модель рассчитана на длинные сессии разработки, knowledge work и reasoning.
Открытые веса дают возможность развернуть модель в своей инфраструктуре, изучать поведение и менять serving stack. Они не делают размещение простым: модель 3T-класса требует серьезных GPU-ресурсов, распределенного inference, мониторинга и компетенции эксплуатации. Перед коммерческим использованием нужно проверить лицензию Kimi K3 и требования к данным. Разницу между открытыми весами и закрытыми моделями разбирает отдельная статья про Open Weight, Open Source и закрытые ИИ.
В официальном API Kimi K3 стоит $3 за input, $0,30 за cached input и $15 за output. Reasoning включен постоянно. В многоходовом разговоре приложение должно возвращать полный assistant message, включая reasoning_content и tool_calls. Если harness сохраняет только видимый content, поведение и качество могут измениться.
Moonshot советует использовать Kimi Code как нативный coding harness. Для честного выбора полезны два теста: один общий нейтральный harness для сравнения базовых моделей и один нативный harness для оценки готового рабочего опыта.
Что на самом деле показывают бенчмарки
Бенчмарк измеряет результат в конкретной конфигурации. В паспорт оценки входят точная модель, уровень effort, версия набора задач, harness, system prompt, инструменты, лимит ходов, retry policy, среда исполнения, дата и способ подсчета. Если часть условий различается, цифры отвечают на разные вопросы. Собственный общий прогон этих четырех моделей для материала не проводился; практические примеры разработчиков ниже остаются vendor claims, а не личным опытом автора.
Релизный срез xAI
В релизе Grok 4.6 разработчик привел такую пару конфигураций:
| Бенчмарк | Grok 4.6 High | GPT-5.6 Sol Max |
|---|---|---|
| AA Intelligence Index | 61 | 61 |
| CursorBench 3.2 | 69,9% | 67,2% |
| DeepSWE 1.1 | 65,9% | 73,0% |
| Terminal-Bench 3.0 | 26,0% | 34,6% |
В одной таблице Grok выигрывает CursorBench, а GPT — DeepSWE и Terminal-Bench. Даже эта компактная выборка не дает одного победителя. Уровни effort различаются, а сторонние scores взяты из публичных карточек и лидербордов. Claude Opus 5 и Kimi K3 в этой конкретной таблице отсутствуют.
Релизный срез Kimi
Технический отчет Kimi K3 публикует другую конфигурацию:
| Бенчмарк | Kimi K3 Max | GPT-5.6 Sol Max | Важное условие |
|---|---|---|---|
| DeepSWE 1.1 | 67,5 | 73,0 | Kimi работает в Kimi Code; GPT — в другой опубликованной связке |
| Terminal-Bench 2.1 | 88,3 | 88,8 | Версия 2.1, поэтому сравнение с Terminal-Bench 3.0 выше некорректно |
| AutomationBench | 30,8 | 29,7 | Общий public subset, но пары model+harness различаются |
| BrowseComp | 91,2 | 90,4 | Для Kimi применена compaction при 300k контекста |
Отчет сравнивает Kimi K3 с Claude Opus 4.8, а не с Claude Opus 5. Подставлять результат Opus 4.8 в колонку Opus 5 нельзя. Релиз Claude Opus 5 содержит отдельные графики и заявления по Frontier-Bench, CursorBench и другим evals, но не дает текстовой общей матрицы с тремя остальными точными моделями в одинаковом harness.
Независимый срез тоже имеет дату
Artificial Analysis Intelligence Index v4.2 обновился 4 сентября 2026 года. В новую версию добавлены агентный AA-Briefcase и длинный документный GDP.pdf, удален насыщенный GPQA Diamond, а доля закрытых тестовых наборов выросла до 40%. Поэтому июльские и августовские числа v4.1/4.1.1 нельзя выдавать за текущие scores v4.2.
Независимый источник уменьшает конфликт интересов, но остается срезом методики. Composite index смешивает несколько классов задач и задает им веса. Команде, которая автоматизирует исправление Java-сервисов, важнее ее закрытый набор bugfix и review, чем высокий средний балл на документах, браузере и научных вопросах.
Четыре класса доказательств
| Класс | Что можно заключить | Чего заключать нельзя |
|---|---|---|
| Официальная спецификация | ID, endpoint, контекст, модальности, цена, поддерживаемые функции | Относительное качество на вашей задаче |
| Vendor benchmark | Какие сценарии разработчик тестировал и в каких условиях получил score | Общее превосходство над всеми моделями и harness |
| Independent eval | Результат в более нейтральной методике на дату среза | Будущую стабильность и пригодность для вашего репозитория |
| Собственный pilot | Приемку, цену, задержку и ошибки в вашем workflow | Универсальное место модели для остальных команд |
Agent harness и его влияние на результат
Agent harness — программный слой вокруг модели. Он собирает контекст, предоставляет инструменты, исполняет действия, возвращает результаты, управляет памятью, повторяет сбойные шаги, проверяет итог и решает, когда остановиться или запросить человека.
Для короткого ответа влияние harness ограничено форматом промпта и парсингом. Для длинного coding-agent цикла он управляет каждым переходом между мыслью, инструментом и новым состоянием репозитория. Поэтому одна модель может получить разные результаты с разными редакторами файлов, поиском, compaction, правилами retry и тестовыми hooks.
Работа Stop Comparing LLM Agents Without Disclosing the Harness предлагает считать score совместным результатом модели и контроллера. Авторы приводят примеры, где смена scaffolding меняет pass rate сильнее, чем замена близких frontier-моделей, и рекомендуют раскрывать конфигурацию harness.
Из каких слоев состоит harness
- Execution: операционная система, контейнер, sandbox, сеть, таймауты и доступные ресурсы.
- Tools: shell, поиск, редактор файлов, браузер, базы данных, MCP и схемы аргументов.
- Context: выбор файлов, retrieval, compaction, summarization и долговременная память.
- Scheduling: основной цикл, подзадачи, параллельность, retries, fallback и критерий остановки.
- Observability: trajectories, tool logs, token accounting, diff и состояние среды.
- Verification: тесты, graders, визуальная проверка, self-check и rollback.
- Governance: права, approval gates, работа с секретами и запрет необратимых действий.
Больше инструментов не всегда помогает. Дублирующиеся функции усложняют выбор, длинные схемы тратят контекст, а неясные ошибки провоцируют повторные вызовы. Минимальный набор с точными описаниями и предсказуемым error contract часто надежнее перегруженного каталога.
Как отделить модель от обвязки
Нужны два разных эксперимента.
В fixed-harness тесте все четыре модели получают одинаковые инструменты, system prompt, budget, retry policy, контейнер и набор задач. Такой тест лучше изолирует различия моделей, хотя единый harness может подходить одним моделям лучше других.
В end-to-end тесте каждая модель работает в рекомендуемом продукте: Grok Build или совместимом агенте, Codex, Claude Code, Kimi Code либо другой выбранной связке. Этот тест отвечает на практический вопрос: какой готовый агент приносит лучший результат команде.
Оба результата полезны. Первый помогает выбрать API-модель для собственной платформы. Второй — выбрать рабочий инструмент разработчика.
Сценарии выбора
| Сценарий | Кого включить в первый короткий список | Почему | Что проверить |
|---|---|---|---|
| Большой рефакторинг и долгий bugfix | GPT-5.6 Sol, Claude Opus 5, Kimi K3 | Контекст около 1M и ориентация на long-horizon coding | Навигацию по репозиторию, качество после compaction, тесты, число вмешательств |
| Много недорогих agent runs | Grok 4.6, затем Kimi K3 API | Более низкая базовая цена output у Grok; Kimi дешевле Opus и Sol | Полный cost/accepted result, cache hit, retries, p95 latency |
| Собственный агент с готовыми hosted tools | GPT-5.6 Sol, Grok 4.6 | Широкая tool surface у OpenAI; web/X/code tools у xAI | Ошибки tool calling, разрешения, переносимость и vendor lock-in |
| Высокая цена ошибки | Claude Opus 5 и GPT-5.6 Sol | Оба нацелены на сложную профессиональную и агентную работу | False positive review, regressions, self-verification, human review minutes |
| Self-hosting и data residency | Kimi K3 | Открытые веса и совместимые inference engines | Лицензию, GPU/энергию, throughput, observability, обновления и безопасность |
| Интерфейсы и визуальные артефакты | Claude Opus 5, Grok 4.6, Kimi K3 | Все три разработчика выделяют visual/interactive работу | Скриншоты на разных viewport, визуальный regression test, доступ к браузеру |
| Документы, таблицы и knowledge work | Claude Opus 5, GPT-5.6 Sol, Kimi K3 | Длинный контекст и целевые agentic scenarios | Точные критерии приемки, цитирование источников, формулы, format QA |
Когда выбирать Grok 4.6
Выберите Grok 4.6 для пилота, если выходных токенов много, бюджет ограничен, 500k контекста хватает, а в workflow полезны web/X search. Не переносите решение в production до проверки длинных циклов, кеша и surcharge после 200k input.
Когда выбирать GPT-5.6 Sol
Начните с GPT-5.6 Sol, если нужна одна сильная модель для кода, документов, поиска, терминала, computer use и MCP. Отдельно измерьте, сколько добавляют high, xhigh и max: максимальный effort может поднять качество, но увеличить счет и задержку.
Когда выбирать Claude Opus 5
Проверьте Claude Opus 5 на самых дорогих ошибках: сложной отладке, крупных изменениях, review, таблицах и долгих автономных задачах. Более высокая цена оправдана, если уменьшаются переделки, время старшего инженера и регрессии.
Когда выбирать Kimi K3
Выберите Kimi K3, если открытые веса, размещение в своем контуре и контроль serving важнее простоты managed API. В расчете должны быть GPU, инженерное сопровождение, отказоустойчивость и обновления. Для API-пилота сохраните полный thinking history и сравните Kimi Code с нейтральным harness.
Как провести свой тест моделей
Подготовьте 20–50 закрытых задач, которых нет в публичных лидербордах. Разделите их по классам: локальный bugfix, multi-file feature, рефакторинг, тесты, code review, работа с длинным документом, браузером и внешним API. Для каждой задачи заранее задайте автоматические проверки и критерии человека.
Затем выполните такой цикл:
- Зафиксируйте точный model ID, provider, reasoning effort и дату.
- Используйте один commit harness, один набор tools и одинаковые лимиты шагов, времени и токенов.
- Запустите каждую комбинацию несколько раз: модели стохастичны, одного прогона мало.
- Сохраните trajectories, tool errors, token usage, wall time, diff и итог тестов.
- Проведите отдельный прогон в нативных harness.
- Добавьте сбои: недоступный API, неполные данные, конфликт инструкций, prompt injection в README, зацикливание и частичный успех.
- Посчитайте стоимость принятого результата и p95 времени, включая проверку человеком и исправление регрессий.
Основные метрики:
- pass@1 и accepted-merge rate;
- доля задач без ручного вмешательства;
- число лишних tool calls и retries;
- стоимость всех попыток на принятый результат;
- p50 и p95 времени до приемки;
- минуты ревью специалиста;
- регрессии, rollback и ложные сообщения «готово»;
- нарушения разрешений, опасные действия и утечки данных.
Вывод
Grok 4.6, GPT-5.6 Sol, Claude Opus 5 и Kimi K3 существуют как отдельные актуальные модели, но доступные публичные цифры не образуют единого честного чемпионата. xAI, Anthropic и Moonshot публикуют результаты в разных harness и версиях тестов; независимые индексы меняют состав и веса. Поэтому места из разных таблиц нельзя механически складывать.
Для большинства команд практичный порядок такой: GPT-5.6 Sol как широкая базовая конфигурация, Grok 4.6 как кандидат на снижение стоимости, Claude Opus 5 для самых сложных и дорогих ошибок, Kimi K3 для открытых весов и контролируемой инфраструктуры. После короткого fixed-harness теста порядок может измениться. Правильный победитель — связка, которая чаще дает принятый результат при приемлемых цене, времени и риске.
Автор статьи

Контент-менеджер AI-раздела
Отвечает за каталог нейросетей и AI-инструментов. Следит за обновлениями LLM-моделей, тестирует новые сервисы и ведёт раздел бесплатных инструментов.
Вопросы и ответы
Без указания задачи и harness вопрос не имеет одного ответа. GPT-5.6 Sol удобен как широкий baseline, Grok 4.6 интересен ценой, Claude Opus 5 — сложными долгими задачами, Kimi K3 — открытыми весами. Проверьте их на одинаковом закрытом наборе.
Только если совпадают версия и split набора, harness, effort, инструменты, лимиты, число попыток и среда. SWE-bench Verified, Pro, Live, DeepSWE и другие варианты — разные оценки.
Версии набора и agent harness меняют сложность и поведение агента. Число 88,3 на Terminal-Bench 2.1 и 26% на Terminal-Bench 3.0 нельзя ставить в одну колонку как рост или падение качества.
Для большого проекта нужны оба. Окно позволяет удержать больше данных, а retrieval и compaction решают, какие данные останутся полезными. Миллион токенов с нерелевантными файлами может работать хуже меньшего, но правильно собранного контекста.
По базовой ставке output дешевле Grok 4.6. По полной задаче победитель неизвестен до прогона: количество шагов, кеш, retries, reasoning tokens, compute и ревью могут изменить порядок.
Нет. 2,8 трлн total parameters требуют серьезной инфраструктуры и оптимизированного inference. Открытость дает контроль, но команда берет на себя размещение, производительность, безопасность и обновления.
Часто да, если harness поддерживает нужный API. Сначала проверьте совместимость tool schemas, reasoning history, streaming, cache и structured outputs. Kimi K3, например, требует сохранять полное assistant message в многоходовой сессии.
Держите собственные evals и traces, отделяйте бизнес-инструменты от API конкретного провайдера, используйте provider-neutral schemas, храните критерии приемки вне промпта и регулярно проверяйте fallback-модель. MCP помогает унифицировать подключение инструментов, но не выравнивает параметры reasoning, кеш, встроенные tools и отказные режимы.
Нет. Зафиксируйте несколько уровней и сравните прирост accepted results с дополнительной ценой и задержкой. Для рутинных задач низкий или средний effort может оказаться выгоднее, а максимальный оставить для редких сложных случаев.
Смотрите также

AI-подписки около $20 в сентябре 2026: где больше лимитов и какие модели дают
20 сентября 2026 г.

CommandCode: обзор AI-агента — модели, тарифы, отзывы и сравнение с конкурентами
20 сентября 2026 г.

Когда происходят акционные сбросы лимитов Codex и как за ними следить
20 сентября 2026 г.

Как купить Cursor Pro+ за $60 или Ultra за $200, если показывается только Pro
19 сентября 2026 г.
Комментарии(0)
Оставьте комментарий
Войдите, чтобы присоединиться к обсуждению