Текущая2026-07-17

От Moonshot AI
Kimi K3 — флагманская мультимодальная MoE-модель Moonshot AI на 2,8 трлн параметров с нативным зрением и контекстным окном 1 048 576 токенов. Она предназначена для длительных задач по программированию, работе с инструментами, исследованиям и обработке документов; в официальной таблице опубликовано 35 результатов бенчмарков. Модель доступна в Kimi, Kimi Work, Kimi Code и через OpenAI-совместимый API; полные веса Moonshot AI обещает выпустить до 27 июля 2026 года.
Kimi K3 сильнее всего выглядит в категориях «рассуждения и агенты». Профиль рассчитан по процентилям LiveBench, Artificial Analysis и LMArena; пропуски не считаются нулём.
Показатели G‑Код, G‑Рассуждения, G‑Агенты и G‑Зрение рассчитаны по массовым таблицам LiveBench, Artificial Analysis и LMArena. Наведите или нажмите на значок рядом с оценкой, чтобы увидеть исходный лидерборд, вариант модели, значение и размер выборки.
Уверенность данных
высокая
Покрытие
9 тестов · 8 направлений
Происхождение
livebench + artificialAnalysis
1 тест · уверенность: низкая
1 тест · уверенность: низкая
2 теста · уверенность: средняя
1 тест · уверенность: низкая
1 тест · уверенность: низкая
1 тест · уверенность: низкая
1 тест · уверенность: низкая
1 тест · уверенность: низкая
Место исходного бенчмарка показывается только при закреплённом source record и среди других карточек с источником. Эти старые значения не участвуют в G-Score лидербордов.
| Бенчмарк | Результат | Место | Доказательство |
|---|---|---|---|
| GPQA (Экспертные знания) | 93.5% | 1 из 4 | Результат разработчика |
| Humanity's Last Exam | 43.5% | 2 из 7 | Результат разработчика |
| Job Bench | 52.9% | 2 из 2 | Результат разработчика |
| MMMU Pro (Мультимодальность) | 81.6% | 1 из 2 | Результат разработчика |
| WorldVQA ForceAnswer | 51% | 2 из 2 | Результат разработчика |
| MCP Atlas | 84.2% | 1 из 4 | Результат разработчика |
| MLS Bench | 48.3% | 1 из 1 | Результат разработчика |
| ZeroBench (pass@5) | 23% | 2 из 2 | Результат разработчика |
| BrowseComp (Веб-поиск) | 91.2% | 2 из 2 | Результат разработчика |
| CharXiv RQ | 84.8% | 3 из 3 | Результат разработчика |
| DECK-Bench (внутренний) | 73.5% | 1 из 1 | Внутренний тест разработчика |
| MathVision | 94.3% | 1 из 2 | Результат разработчика |
| APEX-Agents | 37.6% | 1 из 2 | Результат разработчика |
| DeepSWE 1.1 | 67.5% | 4 из 7 | Результат разработчика |
| FrontierSWE (Dominance) | 81.2% | 1 из 1 | Результат разработчика |
| DeepSearchQA (F1) | 95% | 1 из 1 | Результат разработчика |
| OfficeQA Pro | 63.3% | 2 из 3 | Результат разработчика |
| OmniDocBench | 91.1% | 1 из 1 | Результат разработчика |
| Program Bench | 77.8% | 1 из 1 | Результат разработчика |
| SWE Marathon | 42% | 1 из 1 | Результат разработчика |
| Terminal-Bench 2.1 | 88.3% | 1 из 2 | Результат разработчика |
| Humanity's Last Exam с инструментами | 56% | 4 из 7 | Результат разработчика |
| PostTrain Bench | 36.6% | 1 из 2 | Результат разработчика |
| Automation Bench | 30.8% | 5 из 5 | Результат разработчика |
| Kimi Code Bench 2.0 (внутренний) | 72.9% | 1 из 1 | Внутренний тест разработчика |
| MMMU Pro с Python | 83.4% | 1 из 1 | Результат разработчика |
| PerceptionBench (внутренний) | 58.5% | 1 из 1 | Внутренний тест разработчика |
| AA-Briefcase (Elo) | 1548 | 1 из 1 | Результат разработчика |
| GDPval-AA v2 (Elo) | 1668 | 5 из 8 | Результат разработчика |
| ZeroBench с Python (pass@5) | 41% | 1 из 1 | Результат разработчика |
| BabyVision с Python | 85.7% | 1 из 2 | Результат разработчика |
| CharXiv RQ с Python | 91.3% | 1 из 1 | Результат разработчика |
| MathVision с Python | 97.8% | 1 из 1 | Результат разработчика |
| SpreadsheetBench 2 | 34.8% | 1 из 1 | Результат разработчика |
| Toolathlon Verified | 73.2% | 6 из 8 | Результат разработчика |
Происхождение результатов
Значения перенесены из официальной таблицы Moonshot AI. Методика и дополнительные настройки зависят от конкретного теста и указаны в сносках официального анонса.
Вариант: Kimi K3, maximum reasoning, temperature 1.0, top_p 1.0 · получено 2026-07-20
Kimi K3 — флагманская мультимодальная модель Moonshot AI для долгих задач по программированию, работе с инструментами, исследованиям и обработке документов. У неё 2,8 трлн параметров, нативное зрение и контекстное окно 1 048 576 токенов. Официальный API стоит $3 за 1 млн входных и $15 за 1 млн выходных токенов; при попадании входа в кэш цена снижается до $0,30.
Модель представлена 17 июля 2026 года и уже доступна в Kimi, Kimi Work, Kimi Code и через API под идентификатором kimi-k3. Moonshot AI называет K3 первой открытой моделью класса 3T, но на дату публикации этой карточки полные веса ещё не выложены: компания обещает выпустить их до 27 июля 2026 года.
Kimi K3 построена как сильно разреженная Mixture-of-Experts-модель: на каждом токене активируются 16 из 896 экспертов. В архитектуре используются Kimi Delta Attention, Attention Residuals и Stable LatentMoE. По данным разработчика, сочетание этих решений даёт примерно 2,5-кратный прирост эффективности масштабирования по сравнению с Kimi K2.
Нативная мультимодальность означает, что модель работает не только с текстом, но и с изображениями. Moonshot позиционирует K3 для задач, где код и визуальное восприятие связаны в одном цикле: создание интерфейсов, работа со скриншотами, CAD, игры, анализ графиков и документов.
Ниже приведены все 35 результатов из полной таблицы Moonshot AI. Для Kimi K3 использовался максимальный уровень reasoning effort, temperature = 1.0 и top_p = 1.0. Результаты нельзя воспринимать как полностью независимую оценку: часть прогонов сделана самим разработчиком, а Kimi Code Bench, DECK-Bench и PerceptionBench являются внутренними тестами Moonshot AI.
| Бенчмарк | Kimi K3 | Условия |
|---|---|---|
| DeepSWE 1.1 | 67,5% | KimiCode |
| Program Bench | 77,8% | KimiCode |
| Terminal-Bench 2.1 | 88,3% | KimiCode |
| FrontierSWE | 81,2% | dominance score на 16.07.2026, KimiCode |
| SWE Marathon | 42,0% | Claude Code |
| PostTrain Bench | 36,6% | Claude Code, среднее трёх прогонов на H20 |
| MLS Bench | 48,3% | KimiCode |
| Kimi Code Bench 2.0 | 72,9% | внутренний бенчмарк Moonshot AI |
Для DeepSWE важно различать harness: в сравнительной таблице Moonshot указан результат 67,5% с KimiCode, а в официальном DeepSWE leaderboard с mini-SWE-agent модель получает 67,3%.
| Бенчмарк | Kimi K3 |
|---|---|
| GDPval-AA v2 | 1668 Elo |
| BrowseComp | 91,2% |
| DeepSearchQA | 95,0 F1 |
| Toolathlon Verified | 73,2% |
| MCP Atlas | 84,2% |
| Automation Bench | 30,8% |
| Job Bench | 52,9% |
| AA-Briefcase | 1548 Elo |
| APEX-Agents | 37,6% |
| OfficeQA Pro | 63,3% |
| SpreadsheetBench 2 | 34,8% |
| DECK-Bench | 73,5% |
В MCP Atlas использован публичный набор из 500 задач с лимитом 100 шагов и Gemini 3.1 Pro в роли судьи. Automation Bench прогонялся на публичной выборке из 600 задач. Для BrowseComp применялось сжатие контекста после 300 тысяч токенов; без context management и с полным окном 1M Moonshot отдельно сообщает 90,4%.
| Бенчмарк | Kimi K3 |
|---|---|
| GPQA-Diamond | 93,5% |
| Humanity's Last Exam | 43,5% |
| Humanity's Last Exam с инструментами | 56,0% |
| Бенчмарк | Kimi K3 |
|---|---|
| MMMU-Pro | 81,6% |
| MMMU-Pro с Python | 83,4% |
| CharXiv RQ | 84,8% |
| CharXiv RQ с Python | 91,3% |
| MathVision | 94,3% |
| MathVision с Python | 97,8% |
| BabyVision с Python | 85,7% |
| ZeroBench, pass@5 | 23,0% |
| ZeroBench с Python, pass@5 | 41,0% |
| WorldVQA ForceAnswer | 51,0% |
| OmniDocBench | 91,1% |
| PerceptionBench | 58,5% |
Результаты мультимодальных тестов, кроме ZeroBench, усреднены по трём прогонам; ZeroBench запускался пять раз. PerceptionBench — внутренний тест Moonshot AI на базовые навыки визуального восприятия.
Официальная тарификация kimi-k3 за 1 млн токенов:
| Тип токенов | Цена |
|---|---|
| Вход, cache miss | $3,00 |
| Вход, cache hit | $0,30 |
| Выход | $15,00 |
API поддерживает автоматическое кэширование контекста, tool calling, JSON mode и structured outputs. Для нового проекта важно считать экономику не только по минимальной цене кэшированного ввода: она применяется лишь при повторном использовании уже обработанного контекста.
Moonshot AI отмечает чувствительность K3 к истории reasoning: если агентный фреймворк не возвращает модели предыдущие блоки рассуждений или переключает модель посреди сессии, качество может стать нестабильным. Разработчик рекомендует совместимый harness, например Kimi Code.
Второе ограничение — избыточная инициативность. K3 обучалась на длинных автономных задачах и при неоднозначной постановке может принимать решения за пользователя. Для production-агентов стоит явно задавать разрешённые инструменты, границы действий и условия подтверждения.
Наконец, сама Moonshot AI пишет, что по общему пользовательскому опыту K3 пока уступает сильнейшим проприетарным моделям. Поэтому опубликованные цифры полезны для короткого списка кандидатов, но не заменяют проверку на собственных задачах, репозиториях и документах.
Источники: официальный технический анонс Kimi K3, официальная страница тарифов Kimi K3, Kimi API Platform.
Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.
$3.00 / $15.00 за 1M токенов; кэшированный ввод — $0.30 за 1M токенов
Рассчитать сценарий →История семейства
Последовательность собрана по датам релиза моделей Moonshot AI в каталоге. Она показывает соседние поколения, но не приписывает им совместимость или наследование архитектуры без отдельного источника.
Сервисы, инструменты, материалы и обсуждения, связанные с моделью.
Точных связей пока нет. Искать по разработчику.
Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.