К списку моделей
Логотип Moonshot AI, разработчика Kimi K3

Kimi K3

От Moonshot AI

Open Source
FAMKimi
CTX1M
PAR2.8T; 16/896 экспертов
Релиз: 2026-07-17
FlagshipMoEOpen SourceMultimodalVisionCodingReasoningAgenticGeneralFrontier TOPImage Input

Краткое описание

Kimi K3 — флагманская мультимодальная MoE-модель Moonshot AI на 2,8 трлн параметров с нативным зрением и контекстным окном 1 048 576 токенов. Она предназначена для длительных задач по программированию, работе с инструментами, исследованиям и обработке документов; в официальной таблице опубликовано 35 результатов бенчмарков. Модель доступна в Kimi, Kimi Work, Kimi Code и через OpenAI-совместимый API; полные веса Moonshot AI обещает выпустить до 27 июля 2026 года.

Агрегированный профиль

Kimi K3 сильнее всего выглядит в категории «рассуждения и агенты». Индекс 100/100 рассчитан по процентильным позициям в 2 сопоставимых тестах; уверенность — средняя. Это навигационная оценка, а не замена тесту на ваших задачах.

Рассуждения100/100

2 сопоставимых теста · уверенность: средняя

Агенты100/100

3 сопоставимых теста · уверенность: средняя

Код83/100

1 сопоставимых теста · уверенность: низкая

Зрение75/100

1 сопоставимых теста · уверенность: низкая

Как рассчитан профиль →

Место модели в каталоге

Позиция рассчитана только среди моделей, для которых в каталоге указан результат того же теста. Это помогает сравнивать карточки, но не заменяет проверку модели на вашей задаче.

БенчмаркРезультатМестоДоказательство
DeepSWE 1.167.5%1 из 2Результат разработчика
Program Bench77.8%1 из 1Результат разработчика
Terminal-Bench 2.188.3%2 из 7Результат разработчика
FrontierSWE (Dominance)81.2%1 из 1Результат разработчика
SWE Marathon42%1 из 2Результат разработчика
PostTrain Bench36.6%1 из 1Результат разработчика
MLS Bench48.3%1 из 1Результат разработчика
Kimi Code Bench 2.0 (внутренний)72.9%1 из 1Внутренний тест разработчика
GDPval-AA v2 (Elo)16681 из 3Результат разработчика
BrowseComp (Веб-поиск)91.2%1 из 4Результат разработчика
DeepSearchQA (F1)95%1 из 1Результат разработчика
Toolathlon Verified73.2%1 из 1Результат разработчика
MCP Atlas84.2%1 из 3Результат разработчика
Automation Bench30.8%1 из 1Результат разработчика
Job Bench52.9%1 из 1Результат разработчика
AA-Briefcase (Elo)15481 из 1Результат разработчика
APEX-Agents37.6%1 из 1Результат разработчика
OfficeQA Pro63.3%1 из 1Результат разработчика
SpreadsheetBench 234.8%1 из 1Результат разработчика
DECK-Bench (внутренний)73.5%1 из 1Внутренний тест разработчика
GPQA (Экспертные знания)93.5%2 из 390Результат разработчика
Humanity's Last Exam43.5%1 из 3Результат разработчика
Humanity's Last Exam с инструментами56%1 из 2Результат разработчика
MMMU Pro (Мультимодальность)81.6%2 из 5Результат разработчика
MMMU Pro с Python83.4%1 из 1Результат разработчика
CharXiv RQ84.8%2 из 2Результат разработчика
CharXiv RQ с Python91.3%1 из 1Результат разработчика
MathVision94.3%1 из 2Результат разработчика
MathVision с Python97.8%1 из 1Результат разработчика
BabyVision с Python85.7%1 из 2Результат разработчика
ZeroBench (pass@5)23%1 из 1Результат разработчика
ZeroBench с Python (pass@5)41%1 из 1Результат разработчика
WorldVQA ForceAnswer51%2 из 2Результат разработчика
OmniDocBench91.1%1 из 1Результат разработчика
PerceptionBench (внутренний)58.5%1 из 1Внутренний тест разработчика

Происхождение результатов

Значения перенесены из официальной таблицы Moonshot AI. Методика и дополнительные настройки зависят от конкретного теста и указаны в сносках официального анонса.

Вариант: Kimi K3, maximum reasoning, temperature 1.0, top_p 1.0 · получено 2026-07-20

Подробный обзор модели

Kimi K3 — флагманская мультимодальная модель Moonshot AI для долгих задач по программированию, работе с инструментами, исследованиям и обработке документов. У неё 2,8 трлн параметров, нативное зрение и контекстное окно 1 048 576 токенов. Официальный API стоит $3 за 1 млн входных и $15 за 1 млн выходных токенов; при попадании входа в кэш цена снижается до $0,30.

Модель представлена 17 июля 2026 года и уже доступна в Kimi, Kimi Work, Kimi Code и через API под идентификатором kimi-k3. Moonshot AI называет K3 первой открытой моделью класса 3T, но на дату публикации этой карточки полные веса ещё не выложены: компания обещает выпустить их до 27 июля 2026 года.

Что нового в Kimi K3

Kimi K3 построена как сильно разреженная Mixture-of-Experts-модель: на каждом токене активируются 16 из 896 экспертов. В архитектуре используются Kimi Delta Attention, Attention Residuals и Stable LatentMoE. По данным разработчика, сочетание этих решений даёт примерно 2,5-кратный прирост эффективности масштабирования по сравнению с Kimi K2.

Нативная мультимодальность означает, что модель работает не только с текстом, но и с изображениями. Moonshot позиционирует K3 для задач, где код и визуальное восприятие связаны в одном цикле: создание интерфейсов, работа со скриншотами, CAD, игры, анализ графиков и документов.

Бенчмарки Kimi K3

Ниже приведены все 35 результатов из полной таблицы Moonshot AI. Для Kimi K3 использовался максимальный уровень reasoning effort, temperature = 1.0 и top_p = 1.0. Результаты нельзя воспринимать как полностью независимую оценку: часть прогонов сделана самим разработчиком, а Kimi Code Bench, DECK-Bench и PerceptionBench являются внутренними тестами Moonshot AI.

Программирование

БенчмаркKimi K3Условия
DeepSWE 1.167,5%KimiCode
Program Bench77,8%KimiCode
Terminal-Bench 2.188,3%KimiCode
FrontierSWE81,2%dominance score на 16.07.2026, KimiCode
SWE Marathon42,0%Claude Code
PostTrain Bench36,6%Claude Code, среднее трёх прогонов на H20
MLS Bench48,3%KimiCode
Kimi Code Bench 2.072,9%внутренний бенчмарк Moonshot AI

Для DeepSWE важно различать harness: в сравнительной таблице Moonshot указан результат 67,5% с KimiCode, а в официальном DeepSWE leaderboard с mini-SWE-agent модель получает 67,3%.

Агентные и рабочие задачи

БенчмаркKimi K3
GDPval-AA v21668 Elo
BrowseComp91,2%
DeepSearchQA95,0 F1
Toolathlon Verified73,2%
MCP Atlas84,2%
Automation Bench30,8%
Job Bench52,9%
AA-Briefcase1548 Elo
APEX-Agents37,6%
OfficeQA Pro63,3%
SpreadsheetBench 234,8%
DECK-Bench73,5%

В MCP Atlas использован публичный набор из 500 задач с лимитом 100 шагов и Gemini 3.1 Pro в роли судьи. Automation Bench прогонялся на публичной выборке из 600 задач. Для BrowseComp применялось сжатие контекста после 300 тысяч токенов; без context management и с полным окном 1M Moonshot отдельно сообщает 90,4%.

Рассуждения и знания

БенчмаркKimi K3
GPQA-Diamond93,5%
Humanity's Last Exam43,5%
Humanity's Last Exam с инструментами56,0%

Зрение и работа с документами

БенчмаркKimi K3
MMMU-Pro81,6%
MMMU-Pro с Python83,4%
CharXiv RQ84,8%
CharXiv RQ с Python91,3%
MathVision94,3%
MathVision с Python97,8%
BabyVision с Python85,7%
ZeroBench, pass@523,0%
ZeroBench с Python, pass@541,0%
WorldVQA ForceAnswer51,0%
OmniDocBench91,1%
PerceptionBench58,5%

Результаты мультимодальных тестов, кроме ZeroBench, усреднены по трём прогонам; ZeroBench запускался пять раз. PerceptionBench — внутренний тест Moonshot AI на базовые навыки визуального восприятия.

Цена и доступность API

Официальная тарификация kimi-k3 за 1 млн токенов:

Тип токеновЦена
Вход, cache miss$3,00
Вход, cache hit$0,30
Выход$15,00

API поддерживает автоматическое кэширование контекста, tool calling, JSON mode и structured outputs. Для нового проекта важно считать экономику не только по минимальной цене кэшированного ввода: она применяется лишь при повторном использовании уже обработанного контекста.

Ограничения

Moonshot AI отмечает чувствительность K3 к истории reasoning: если агентный фреймворк не возвращает модели предыдущие блоки рассуждений или переключает модель посреди сессии, качество может стать нестабильным. Разработчик рекомендует совместимый harness, например Kimi Code.

Второе ограничение — избыточная инициативность. K3 обучалась на длинных автономных задачах и при неоднозначной постановке может принимать решения за пользователя. Для production-агентов стоит явно задавать разрешённые инструменты, границы действий и условия подтверждения.

Наконец, сама Moonshot AI пишет, что по общему пользовательскому опыту K3 пока уступает сильнейшим проприетарным моделям. Поэтому опубликованные цифры полезны для короткого списка кандидатов, но не заменяют проверку на собственных задачах, репозиториях и документах.

Источники: официальный технический анонс Kimi K3, официальная страница тарифов Kimi K3, Kimi API Platform.

Где запустить модель

Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.

Обновляем провайдеров и цены…

Стоимость API

$3.00 / $15.00 за 1M токенов; кэшированный ввод — $0.30 за 1M токенов

Профиль модели

GPQA93.5%DeepSWE 1.167.5%Marathon42%T-Bench88.3%Browse91.2%MMMU81.6%

Бенчмарки

DeepSWE 1.167.5%
Program Bench77.8%
Terminal-Bench 2.188.3%
FrontierSWE (Dominance)81.2%
SWE Marathon42%
PostTrain Bench36.6%
MLS Bench48.3%
Kimi Code Bench 2.0 (внутренний)72.9%
GDPval-AA v2 (Elo)1668
BrowseComp (Веб-поиск)91.2%
DeepSearchQA (F1)95%
Toolathlon Verified73.2%
MCP Atlas84.2%
Automation Bench30.8%
Job Bench52.9%
AA-Briefcase (Elo)1548
APEX-Agents37.6%
OfficeQA Pro63.3%
SpreadsheetBench 234.8%
DECK-Bench (внутренний)73.5%
GPQA (Экспертные знания)93.5%
Humanity's Last Exam43.5%
Humanity's Last Exam с инструментами56%
MMMU Pro (Мультимодальность)81.6%
MMMU Pro с Python83.4%
CharXiv RQ84.8%
CharXiv RQ с Python91.3%
MathVision94.3%
MathVision с Python97.8%
BabyVision с Python85.7%
ZeroBench (pass@5)23%
ZeroBench с Python (pass@5)41%
WorldVQA ForceAnswer51%
OmniDocBench91.1%
PerceptionBench (внутренний)58.5%

Другие модели семейства Kimi

Экосистема Kimi K3

Сервисы, инструменты, материалы и обсуждения, связанные с моделью.

Сервисы с поддержкой модели

Откройте результаты по названию модели и проверьте актуальную интеграцию.

Искать в /services/ →

MCP и инструменты

Весь каталог

Точных связей пока нет. Искать по разработчику.

Обсуждения о Kimi K3

Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.

Создать обсуждение