К списку моделей
Логотип Moonshot AI, разработчика Kimi K3

Kimi K3

G-Score80/100высокая#4 из 37Методология G-Score

От Moonshot AI

Open Source
FAMKimi
CTX1M
PAR2.8T; 16/896 экспертов
Релиз: 2026-07-17
FlagshipMoEOpen SourceMultimodalVisionCodingReasoningAgenticGeneralFrontier TOPImage Input

Краткое описание

Kimi K3 — флагманская мультимодальная MoE-модель Moonshot AI на 2,8 трлн параметров с нативным зрением и контекстным окном 1 048 576 токенов. Она предназначена для длительных задач по программированию, работе с инструментами, исследованиям и обработке документов; в официальной таблице опубликовано 35 результатов бенчмарков. Модель доступна в Kimi, Kimi Work, Kimi Code и через OpenAI-совместимый API; полные веса Moonshot AI обещает выпустить до 27 июля 2026 года.

G-Score и профиль

G-Score80/100высокая#4 из 37Методология G-Score

Kimi K3 сильнее всего выглядит в категориях «рассуждения и агенты». Профиль рассчитан по процентилям LiveBench, Artificial Analysis и LMArena; пропуски не считаются нулём.

Показатели G‑Код, G‑Рассуждения, G‑Агенты и G‑Зрение рассчитаны по массовым таблицам LiveBench, Artificial Analysis и LMArena. Наведите или нажмите на значок рядом с оценкой, чтобы увидеть исходный лидерборд, вариант модели, значение и размер выборки.

Уверенность данных

высокая

Покрытие

9 тестов · 8 направлений

Происхождение

livebench + artificialAnalysis

G‑Рассуждения97/100

1 тест · уверенность: низкая

G‑Агенты95/100

1 тест · уверенность: низкая

G‑Общее качество93/100

2 теста · уверенность: средняя

G‑Язык90/100

1 тест · уверенность: низкая

G‑Код79/100

1 тест · уверенность: низкая

G‑Работа с данными76/100

1 тест · уверенность: низкая

G‑Следование инструкциям69/100

1 тест · уверенность: низкая

G‑Математика24/100

1 тест · уверенность: низкая

Как рассчитан профиль →

Место модели в каталоге

Место исходного бенчмарка показывается только при закреплённом source record и среди других карточек с источником. Эти старые значения не участвуют в G-Score лидербордов.

БенчмаркРезультатМестоДоказательство
GPQA (Экспертные знания)93.5%1 из 4Результат разработчика
Humanity's Last Exam43.5%2 из 7Результат разработчика
Job Bench52.9%2 из 2Результат разработчика
MMMU Pro (Мультимодальность)81.6%1 из 2Результат разработчика
WorldVQA ForceAnswer51%2 из 2Результат разработчика
MCP Atlas84.2%1 из 4Результат разработчика
MLS Bench48.3%1 из 1Результат разработчика
ZeroBench (pass@5)23%2 из 2Результат разработчика
BrowseComp (Веб-поиск)91.2%2 из 2Результат разработчика
CharXiv RQ84.8%3 из 3Результат разработчика
DECK-Bench (внутренний)73.5%1 из 1Внутренний тест разработчика
MathVision94.3%1 из 2Результат разработчика
APEX-Agents37.6%1 из 2Результат разработчика
DeepSWE 1.167.5%4 из 7Результат разработчика
FrontierSWE (Dominance)81.2%1 из 1Результат разработчика
DeepSearchQA (F1)95%1 из 1Результат разработчика
OfficeQA Pro63.3%2 из 3Результат разработчика
OmniDocBench91.1%1 из 1Результат разработчика
Program Bench77.8%1 из 1Результат разработчика
SWE Marathon42%1 из 1Результат разработчика
Terminal-Bench 2.188.3%1 из 2Результат разработчика
Humanity's Last Exam с инструментами56%4 из 7Результат разработчика
PostTrain Bench36.6%1 из 2Результат разработчика
Automation Bench30.8%5 из 5Результат разработчика
Kimi Code Bench 2.0 (внутренний)72.9%1 из 1Внутренний тест разработчика
MMMU Pro с Python83.4%1 из 1Результат разработчика
PerceptionBench (внутренний)58.5%1 из 1Внутренний тест разработчика
AA-Briefcase (Elo)15481 из 1Результат разработчика
GDPval-AA v2 (Elo)16685 из 8Результат разработчика
ZeroBench с Python (pass@5)41%1 из 1Результат разработчика
BabyVision с Python85.7%1 из 2Результат разработчика
CharXiv RQ с Python91.3%1 из 1Результат разработчика
MathVision с Python97.8%1 из 1Результат разработчика
SpreadsheetBench 234.8%1 из 1Результат разработчика
Toolathlon Verified73.2%6 из 8Результат разработчика

Происхождение результатов

Значения перенесены из официальной таблицы Moonshot AI. Методика и дополнительные настройки зависят от конкретного теста и указаны в сносках официального анонса.

Вариант: Kimi K3, maximum reasoning, temperature 1.0, top_p 1.0 · получено 2026-07-20

Подробный обзор модели

Kimi K3 — флагманская мультимодальная модель Moonshot AI для долгих задач по программированию, работе с инструментами, исследованиям и обработке документов. У неё 2,8 трлн параметров, нативное зрение и контекстное окно 1 048 576 токенов. Официальный API стоит $3 за 1 млн входных и $15 за 1 млн выходных токенов; при попадании входа в кэш цена снижается до $0,30.

Модель представлена 17 июля 2026 года и уже доступна в Kimi, Kimi Work, Kimi Code и через API под идентификатором kimi-k3. Moonshot AI называет K3 первой открытой моделью класса 3T, но на дату публикации этой карточки полные веса ещё не выложены: компания обещает выпустить их до 27 июля 2026 года.

Что нового в Kimi K3

Kimi K3 построена как сильно разреженная Mixture-of-Experts-модель: на каждом токене активируются 16 из 896 экспертов. В архитектуре используются Kimi Delta Attention, Attention Residuals и Stable LatentMoE. По данным разработчика, сочетание этих решений даёт примерно 2,5-кратный прирост эффективности масштабирования по сравнению с Kimi K2.

Нативная мультимодальность означает, что модель работает не только с текстом, но и с изображениями. Moonshot позиционирует K3 для задач, где код и визуальное восприятие связаны в одном цикле: создание интерфейсов, работа со скриншотами, CAD, игры, анализ графиков и документов.

Бенчмарки Kimi K3

Ниже приведены все 35 результатов из полной таблицы Moonshot AI. Для Kimi K3 использовался максимальный уровень reasoning effort, temperature = 1.0 и top_p = 1.0. Результаты нельзя воспринимать как полностью независимую оценку: часть прогонов сделана самим разработчиком, а Kimi Code Bench, DECK-Bench и PerceptionBench являются внутренними тестами Moonshot AI.

Программирование

БенчмаркKimi K3Условия
DeepSWE 1.167,5%KimiCode
Program Bench77,8%KimiCode
Terminal-Bench 2.188,3%KimiCode
FrontierSWE81,2%dominance score на 16.07.2026, KimiCode
SWE Marathon42,0%Claude Code
PostTrain Bench36,6%Claude Code, среднее трёх прогонов на H20
MLS Bench48,3%KimiCode
Kimi Code Bench 2.072,9%внутренний бенчмарк Moonshot AI

Для DeepSWE важно различать harness: в сравнительной таблице Moonshot указан результат 67,5% с KimiCode, а в официальном DeepSWE leaderboard с mini-SWE-agent модель получает 67,3%.

Агентные и рабочие задачи

БенчмаркKimi K3
GDPval-AA v21668 Elo
BrowseComp91,2%
DeepSearchQA95,0 F1
Toolathlon Verified73,2%
MCP Atlas84,2%
Automation Bench30,8%
Job Bench52,9%
AA-Briefcase1548 Elo
APEX-Agents37,6%
OfficeQA Pro63,3%
SpreadsheetBench 234,8%
DECK-Bench73,5%

В MCP Atlas использован публичный набор из 500 задач с лимитом 100 шагов и Gemini 3.1 Pro в роли судьи. Automation Bench прогонялся на публичной выборке из 600 задач. Для BrowseComp применялось сжатие контекста после 300 тысяч токенов; без context management и с полным окном 1M Moonshot отдельно сообщает 90,4%.

Рассуждения и знания

БенчмаркKimi K3
GPQA-Diamond93,5%
Humanity's Last Exam43,5%
Humanity's Last Exam с инструментами56,0%

Зрение и работа с документами

БенчмаркKimi K3
MMMU-Pro81,6%
MMMU-Pro с Python83,4%
CharXiv RQ84,8%
CharXiv RQ с Python91,3%
MathVision94,3%
MathVision с Python97,8%
BabyVision с Python85,7%
ZeroBench, pass@523,0%
ZeroBench с Python, pass@541,0%
WorldVQA ForceAnswer51,0%
OmniDocBench91,1%
PerceptionBench58,5%

Результаты мультимодальных тестов, кроме ZeroBench, усреднены по трём прогонам; ZeroBench запускался пять раз. PerceptionBench — внутренний тест Moonshot AI на базовые навыки визуального восприятия.

Цена и доступность API

Официальная тарификация kimi-k3 за 1 млн токенов:

Тип токеновЦена
Вход, cache miss$3,00
Вход, cache hit$0,30
Выход$15,00

API поддерживает автоматическое кэширование контекста, tool calling, JSON mode и structured outputs. Для нового проекта важно считать экономику не только по минимальной цене кэшированного ввода: она применяется лишь при повторном использовании уже обработанного контекста.

Ограничения

Moonshot AI отмечает чувствительность K3 к истории reasoning: если агентный фреймворк не возвращает модели предыдущие блоки рассуждений или переключает модель посреди сессии, качество может стать нестабильным. Разработчик рекомендует совместимый harness, например Kimi Code.

Второе ограничение — избыточная инициативность. K3 обучалась на длинных автономных задачах и при неоднозначной постановке может принимать решения за пользователя. Для production-агентов стоит явно задавать разрешённые инструменты, границы действий и условия подтверждения.

Наконец, сама Moonshot AI пишет, что по общему пользовательскому опыту K3 пока уступает сильнейшим проприетарным моделям. Поэтому опубликованные цифры полезны для короткого списка кандидатов, но не заменяют проверку на собственных задачах, репозиториях и документах.

Источники: официальный технический анонс Kimi K3, официальная страница тарифов Kimi K3, Kimi API Platform.

Где запустить модель

Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.

Обновляем провайдеров и цены…

Стоимость API

$3.00 / $15.00 за 1M токенов; кэшированный ввод — $0.30 за 1M токенов

Рассчитать сценарий →

Профиль модели

GPQA93.5%DeepSWE 1.167.5%Marathon42%T-Bench88.3%Browse91.2%MMMU81.6%

Бенчмарки

GPQA (Экспертные знания)93.5%
Humanity's Last Exam43.5%
Job Bench52.9%
MMMU Pro (Мультимодальность)81.6%
WorldVQA ForceAnswer51%
MCP Atlas84.2%
MLS Bench48.3%
ZeroBench (pass@5)23%
BrowseComp (Веб-поиск)91.2%
CharXiv RQ84.8%
DECK-Bench (внутренний)73.5%
MathVision94.3%
APEX-Agents37.6%
DeepSWE 1.167.5%
FrontierSWE (Dominance)81.2%
DeepSearchQA (F1)95%
OfficeQA Pro63.3%
OmniDocBench91.1%
Program Bench77.8%
SWE Marathon42%
Terminal-Bench 2.188.3%
Humanity's Last Exam с инструментами56%
PostTrain Bench36.6%
Automation Bench30.8%
Kimi Code Bench 2.0 (внутренний)72.9%
MMMU Pro с Python83.4%
PerceptionBench (внутренний)58.5%
AA-Briefcase (Elo)1548
GDPval-AA v2 (Elo)1668
ZeroBench с Python (pass@5)41%
BabyVision с Python85.7%
CharXiv RQ с Python91.3%
MathVision с Python97.8%
SpreadsheetBench 234.8%
Toolathlon Verified73.2%

История семейства

Линейка Kimi

Последовательность собрана по датам релиза моделей Moonshot AI в каталоге. Она показывает соседние поколения, но не приписывает им совместимость или наследование архитектуры без отдельного источника.

Экосистема Kimi K3

Сервисы, инструменты, материалы и обсуждения, связанные с моделью.

MCP и инструменты

Весь каталог

Точных связей пока нет. Искать по разработчику.

Статьи и термины

Все статьи

Обсуждения о Kimi K3

Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.

Создать обсуждение