
От Moonshot AI
Kimi K3 — флагманская мультимодальная MoE-модель Moonshot AI на 2,8 трлн параметров с нативным зрением и контекстным окном 1 048 576 токенов. Она предназначена для длительных задач по программированию, работе с инструментами, исследованиям и обработке документов; в официальной таблице опубликовано 35 результатов бенчмарков. Модель доступна в Kimi, Kimi Work, Kimi Code и через OpenAI-совместимый API; полные веса Moonshot AI обещает выпустить до 27 июля 2026 года.
Kimi K3 сильнее всего выглядит в категории «рассуждения и агенты». Индекс 100/100 рассчитан по процентильным позициям в 2 сопоставимых тестах; уверенность — средняя. Это навигационная оценка, а не замена тесту на ваших задачах.
2 сопоставимых теста · уверенность: средняя
3 сопоставимых теста · уверенность: средняя
1 сопоставимых теста · уверенность: низкая
1 сопоставимых теста · уверенность: низкая
Позиция рассчитана только среди моделей, для которых в каталоге указан результат того же теста. Это помогает сравнивать карточки, но не заменяет проверку модели на вашей задаче.
| Бенчмарк | Результат | Место | Доказательство |
|---|---|---|---|
| DeepSWE 1.1 | 67.5% | 1 из 2 | Результат разработчика |
| Program Bench | 77.8% | 1 из 1 | Результат разработчика |
| Terminal-Bench 2.1 | 88.3% | 2 из 7 | Результат разработчика |
| FrontierSWE (Dominance) | 81.2% | 1 из 1 | Результат разработчика |
| SWE Marathon | 42% | 1 из 2 | Результат разработчика |
| PostTrain Bench | 36.6% | 1 из 1 | Результат разработчика |
| MLS Bench | 48.3% | 1 из 1 | Результат разработчика |
| Kimi Code Bench 2.0 (внутренний) | 72.9% | 1 из 1 | Внутренний тест разработчика |
| GDPval-AA v2 (Elo) | 1668 | 1 из 3 | Результат разработчика |
| BrowseComp (Веб-поиск) | 91.2% | 1 из 4 | Результат разработчика |
| DeepSearchQA (F1) | 95% | 1 из 1 | Результат разработчика |
| Toolathlon Verified | 73.2% | 1 из 1 | Результат разработчика |
| MCP Atlas | 84.2% | 1 из 3 | Результат разработчика |
| Automation Bench | 30.8% | 1 из 1 | Результат разработчика |
| Job Bench | 52.9% | 1 из 1 | Результат разработчика |
| AA-Briefcase (Elo) | 1548 | 1 из 1 | Результат разработчика |
| APEX-Agents | 37.6% | 1 из 1 | Результат разработчика |
| OfficeQA Pro | 63.3% | 1 из 1 | Результат разработчика |
| SpreadsheetBench 2 | 34.8% | 1 из 1 | Результат разработчика |
| DECK-Bench (внутренний) | 73.5% | 1 из 1 | Внутренний тест разработчика |
| GPQA (Экспертные знания) | 93.5% | 2 из 390 | Результат разработчика |
| Humanity's Last Exam | 43.5% | 1 из 3 | Результат разработчика |
| Humanity's Last Exam с инструментами | 56% | 1 из 2 | Результат разработчика |
| MMMU Pro (Мультимодальность) | 81.6% | 2 из 5 | Результат разработчика |
| MMMU Pro с Python | 83.4% | 1 из 1 | Результат разработчика |
| CharXiv RQ | 84.8% | 2 из 2 | Результат разработчика |
| CharXiv RQ с Python | 91.3% | 1 из 1 | Результат разработчика |
| MathVision | 94.3% | 1 из 2 | Результат разработчика |
| MathVision с Python | 97.8% | 1 из 1 | Результат разработчика |
| BabyVision с Python | 85.7% | 1 из 2 | Результат разработчика |
| ZeroBench (pass@5) | 23% | 1 из 1 | Результат разработчика |
| ZeroBench с Python (pass@5) | 41% | 1 из 1 | Результат разработчика |
| WorldVQA ForceAnswer | 51% | 2 из 2 | Результат разработчика |
| OmniDocBench | 91.1% | 1 из 1 | Результат разработчика |
| PerceptionBench (внутренний) | 58.5% | 1 из 1 | Внутренний тест разработчика |
Происхождение результатов
Значения перенесены из официальной таблицы Moonshot AI. Методика и дополнительные настройки зависят от конкретного теста и указаны в сносках официального анонса.
Вариант: Kimi K3, maximum reasoning, temperature 1.0, top_p 1.0 · получено 2026-07-20
Kimi K3 — флагманская мультимодальная модель Moonshot AI для долгих задач по программированию, работе с инструментами, исследованиям и обработке документов. У неё 2,8 трлн параметров, нативное зрение и контекстное окно 1 048 576 токенов. Официальный API стоит $3 за 1 млн входных и $15 за 1 млн выходных токенов; при попадании входа в кэш цена снижается до $0,30.
Модель представлена 17 июля 2026 года и уже доступна в Kimi, Kimi Work, Kimi Code и через API под идентификатором kimi-k3. Moonshot AI называет K3 первой открытой моделью класса 3T, но на дату публикации этой карточки полные веса ещё не выложены: компания обещает выпустить их до 27 июля 2026 года.
Kimi K3 построена как сильно разреженная Mixture-of-Experts-модель: на каждом токене активируются 16 из 896 экспертов. В архитектуре используются Kimi Delta Attention, Attention Residuals и Stable LatentMoE. По данным разработчика, сочетание этих решений даёт примерно 2,5-кратный прирост эффективности масштабирования по сравнению с Kimi K2.
Нативная мультимодальность означает, что модель работает не только с текстом, но и с изображениями. Moonshot позиционирует K3 для задач, где код и визуальное восприятие связаны в одном цикле: создание интерфейсов, работа со скриншотами, CAD, игры, анализ графиков и документов.
Ниже приведены все 35 результатов из полной таблицы Moonshot AI. Для Kimi K3 использовался максимальный уровень reasoning effort, temperature = 1.0 и top_p = 1.0. Результаты нельзя воспринимать как полностью независимую оценку: часть прогонов сделана самим разработчиком, а Kimi Code Bench, DECK-Bench и PerceptionBench являются внутренними тестами Moonshot AI.
| Бенчмарк | Kimi K3 | Условия |
|---|---|---|
| DeepSWE 1.1 | 67,5% | KimiCode |
| Program Bench | 77,8% | KimiCode |
| Terminal-Bench 2.1 | 88,3% | KimiCode |
| FrontierSWE | 81,2% | dominance score на 16.07.2026, KimiCode |
| SWE Marathon | 42,0% | Claude Code |
| PostTrain Bench | 36,6% | Claude Code, среднее трёх прогонов на H20 |
| MLS Bench | 48,3% | KimiCode |
| Kimi Code Bench 2.0 | 72,9% | внутренний бенчмарк Moonshot AI |
Для DeepSWE важно различать harness: в сравнительной таблице Moonshot указан результат 67,5% с KimiCode, а в официальном DeepSWE leaderboard с mini-SWE-agent модель получает 67,3%.
| Бенчмарк | Kimi K3 |
|---|---|
| GDPval-AA v2 | 1668 Elo |
| BrowseComp | 91,2% |
| DeepSearchQA | 95,0 F1 |
| Toolathlon Verified | 73,2% |
| MCP Atlas | 84,2% |
| Automation Bench | 30,8% |
| Job Bench | 52,9% |
| AA-Briefcase | 1548 Elo |
| APEX-Agents | 37,6% |
| OfficeQA Pro | 63,3% |
| SpreadsheetBench 2 | 34,8% |
| DECK-Bench | 73,5% |
В MCP Atlas использован публичный набор из 500 задач с лимитом 100 шагов и Gemini 3.1 Pro в роли судьи. Automation Bench прогонялся на публичной выборке из 600 задач. Для BrowseComp применялось сжатие контекста после 300 тысяч токенов; без context management и с полным окном 1M Moonshot отдельно сообщает 90,4%.
| Бенчмарк | Kimi K3 |
|---|---|
| GPQA-Diamond | 93,5% |
| Humanity's Last Exam | 43,5% |
| Humanity's Last Exam с инструментами | 56,0% |
| Бенчмарк | Kimi K3 |
|---|---|
| MMMU-Pro | 81,6% |
| MMMU-Pro с Python | 83,4% |
| CharXiv RQ | 84,8% |
| CharXiv RQ с Python | 91,3% |
| MathVision | 94,3% |
| MathVision с Python | 97,8% |
| BabyVision с Python | 85,7% |
| ZeroBench, pass@5 | 23,0% |
| ZeroBench с Python, pass@5 | 41,0% |
| WorldVQA ForceAnswer | 51,0% |
| OmniDocBench | 91,1% |
| PerceptionBench | 58,5% |
Результаты мультимодальных тестов, кроме ZeroBench, усреднены по трём прогонам; ZeroBench запускался пять раз. PerceptionBench — внутренний тест Moonshot AI на базовые навыки визуального восприятия.
Официальная тарификация kimi-k3 за 1 млн токенов:
| Тип токенов | Цена |
|---|---|
| Вход, cache miss | $3,00 |
| Вход, cache hit | $0,30 |
| Выход | $15,00 |
API поддерживает автоматическое кэширование контекста, tool calling, JSON mode и structured outputs. Для нового проекта важно считать экономику не только по минимальной цене кэшированного ввода: она применяется лишь при повторном использовании уже обработанного контекста.
Moonshot AI отмечает чувствительность K3 к истории reasoning: если агентный фреймворк не возвращает модели предыдущие блоки рассуждений или переключает модель посреди сессии, качество может стать нестабильным. Разработчик рекомендует совместимый harness, например Kimi Code.
Второе ограничение — избыточная инициативность. K3 обучалась на длинных автономных задачах и при неоднозначной постановке может принимать решения за пользователя. Для production-агентов стоит явно задавать разрешённые инструменты, границы действий и условия подтверждения.
Наконец, сама Moonshot AI пишет, что по общему пользовательскому опыту K3 пока уступает сильнейшим проприетарным моделям. Поэтому опубликованные цифры полезны для короткого списка кандидатов, но не заменяют проверку на собственных задачах, репозиториях и документах.
Источники: официальный технический анонс Kimi K3, официальная страница тарифов Kimi K3, Kimi API Platform.
Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.
$3.00 / $15.00 за 1M токенов; кэшированный ввод — $0.30 за 1M токенов
Сервисы, инструменты, материалы и обсуждения, связанные с моделью.
Откройте результаты по названию модели и проверьте актуальную интеграцию.
Точных связей пока нет. Искать по разработчику.
Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.