К списку моделей
Логотип Qwen, разработчика Qwen3.8-Max

Qwen3.8-Max

G-Score70.9/100высокая#7 из 37Методология G-Score

От Qwen

Proprietary
FAMQwen
CTX1M
PAR2.4T (95B active)
Релиз: 2026-08-03
FlagshipMaxMultimodalVisionCodingReasoningAgenticGeneralImage Input

Краткое описание

Qwen3.8-Max — мультимодальная флагманская MoE-модель Qwen для программирования, длительных агентных задач и работы с текстом, изображениями и видео. В API используется идентификатор qwen3.8-max; модель имеет 2,4 трлн параметров, из которых 95 млрд активны, контекст до 1 млн токенов и поддерживает function calling, structured output, web search, context cache и batch inference.

G-Score и профиль

G-Score70.9/100высокая#7 из 37Методология G-Score

Qwen3.8-Max сильнее всего выглядит в категориях «агенты и зрение». Профиль рассчитан по процентилям LiveBench, Artificial Analysis и LMArena; пропуски не считаются нулём.

Показатели G‑Код, G‑Рассуждения, G‑Агенты и G‑Зрение рассчитаны по массовым таблицам LiveBench, Artificial Analysis и LMArena. Наведите или нажмите на значок рядом с оценкой, чтобы увидеть исходный лидерборд, вариант модели, значение и размер выборки.

Уверенность данных

высокая

Покрытие

10 тестов · 9 направлений

Происхождение

livebench + artificialAnalysis + lmarenaVision

G‑Агенты100/100

1 тест · уверенность: низкая

G‑Зрение98/100

1 тест · уверенность: средняя

G‑Общее качество91/100

2 теста · уверенность: средняя

G‑Следование инструкциям86/100

1 тест · уверенность: низкая

G‑Рассуждения72/100

1 тест · уверенность: низкая

G‑Работа с данными69/100

1 тест · уверенность: низкая

G‑Математика69/100

1 тест · уверенность: низкая

G‑Язык52/100

1 тест · уверенность: низкая

G‑Код21/100

1 тест · уверенность: низкая

Как рассчитан профиль →

Место модели в каталоге

Место исходного бенчмарка показывается только при закреплённом source record и среди других карточек с источником. Эти старые значения не участвуют в G-Score лидербордов.

БенчмаркРезультатМестоДоказательство
Terminal-Bench 2.186.6%н/дИсточник не указан
SWE Bench Pro67.7%н/дИсточник не указан
DeepSWE 1.156.6%н/дИсточник не указан
NL2Repo55.9%н/дИсточник не указан
FrontierSWE (Dominance)73.5%н/дИсточник не указан
MLS_Bench_Lite41%н/дИсточник не указан
PaperBench93%н/дИсточник не указан
AndroidBench75.1%н/дИсточник не указан
QwenSWEBench80.7%н/дИсточник не указан
QwenQoderBench58.4%н/дИсточник не указан
QwenReactBench_Elo1724н/дИсточник не указан
QwenSVGBench_Elo1713н/дИсточник не указан
CoWorkBench (внутренний)74.8%н/дИсточник не указан
WorkSpaceBench67.7%н/дИсточник не указан
Job Bench53.4%н/дИсточник не указан
SkillsBench70.2%н/дИсточник не указан
Agents_Last_Exam_Score52.4%н/дИсточник не указан
Automation_Bench27.3%н/дИсточник не указан
Toolathlon Verified72.5%н/дИсточник не указан
WideSearch81.9%н/дИсточник не указан
Humanity's Last Exam с инструментами56.2%н/дИсточник не указан
GPQA (Экспертные знания)92.6%н/дИсточник не указан
Humanity's Last Exam43.6%н/дИсточник не указан
IFBench82.8%н/дИсточник не указан
OneMillion_Bench52.5%н/дИсточник не указан
HealthBench60.2%н/дИсточник не указан
PLawBench73.2%н/дИсточник не указан
PRBench_Legal57.6%н/дИсточник не указан
PRBench_Finance58.3%н/дИсточник не указан
MRCR_v2_256k92.9%н/дИсточник не указан
LongBench_v266.3%н/дИсточник не указан
MMMU Pro (Мультимодальность)82.3%н/дИсточник не указан
MathVision95.2%н/дИсточник не указан
BabyVision82%н/дИсточник не указан
HLE_VL_Tools52.2%н/дИсточник не указан
ZeroBench_Sub48.5%н/дИсточник не указан
LogicVista91.9%н/дИсточник не указан
HiPhO90%н/дИсточник не указан
PhyX83.5%н/дИсточник не указан
SLAKE90.8%н/дИсточник не указан
MedXpertQA-MM80.4%н/дИсточник не указан
OSWorld-Verified86.1%н/дИсточник не указан
ScreenSpot Pro84.5%н/дИсточник не указан
WebArena_Verified66.8%н/дИсточник не указан
AndroidWorld85.3%н/дИсточник не указан
MobileWorld77.8%н/дИсточник не указан
Vision2Web69%н/дИсточник не указан
Parametric_CAD_Bench91.5%н/дИсточник не указан
OmniDocBench 1.592.1%н/дИсточник не указан
OCR-Bench-v2 EN74.2%н/дИсточник не указан
OCR-Bench-v2 ZH68.3%н/дИсточник не указан
RealWorldQA88%н/дИсточник не указан
ERQA77.8%н/дИсточник не указан
LingoQA84.8%н/дИсточник не указан
SimpleVQA75%н/дИсточник не указан
WorldVQA ForceAnswer53.2%н/дИсточник не указан
MMStar85.9%н/дИсточник не указан
CountQA82.4%н/дИсточник не указан
VideoMME90.4%н/дИсточник не указан
VideoMMMU88.7%н/дИсточник не указан
MMVU82.4%н/дИсточник не указан
MLVU90.8%н/дИсточник не указан
TVBench81.9%н/дИсточник не указан
LVBench81.8%н/дИсточник не указан

Подробный обзор модели

Qwen3.8-Max — официальная мультимодальная флагманская модель Qwen, выпущенная 3 августа 2026 года. В API она вызывается как qwen3.8-max. Модель построена как MoE на 2,4 трлн параметров с 95 млрд активных параметров и принимает текст, изображения и видео в контексте до 1 млн токенов.

Модель доступна через Alibaba Cloud Model Studio и QwenCloud. В экосистеме с ней связаны Qwen Studio и Qwen Code; каталог покажет их карточки после штатной публикации. Это не отдельная модель с названием «Qwen 3.8» без суффикса: подтверждённый публичный API-ID относится именно к Max-варианту.

Возможности и ограничения API

Официальная карточка Model Studio указывает function calling, structured output, web search, context cache и batch inference. Максимальный контекст составляет 1 000 000 токенов, максимальный вход — 991 808 токенов, максимальный вывод — 131 072 токена. Fine-tuning для этой модели не заявлен.

На дату проверки стандартная цена Model Studio составляет $1,65 за 1 млн входных и $4,951 за 1 млн выходных токенов. Акции, batch inference и попадание в context cache могут менять фактическую стоимость, поэтому карточка хранит базовую цену без временных скидок.

Qwen объявила, что открытые веса будут опубликованы через неделю после релиза. До появления отдельной официальной model card с файлами и лицензией каталог не помечает Qwen3.8-Max как Open Source или Open Weights.

Бенчмарки Qwen3.8-Max

Все числа ниже опубликованы самой Qwen Team. Часть тестов выполнена во внутренних harness или на собственных наборах, поэтому их нельзя считать независимым рейтингом.

Код и агентные задачи

ТестРезультатУсловия из релиза
Terminal-Bench 2.186,6%Claude Code, avg@10, лимит 5 часов
SWE-bench Pro67,7%Claude Code, контекст 256K
DeepSWE 1.156,6%лучший результат из двух harness
FrontierSWE73,5%mean@5
PaperBench93,0%среднее по трём запускам
AndroidBench75,1%avg@3 на публичных 95 задачах
SkillsBench70,2%среднее по трём запускам
Toolathlon Verified72,5%pass@1
WideSearch81,9%средний item-F1 по четырём запускам

Общие и длинные задачи

ТестРезультат
GPQA Diamond92,6%
HLE43,6%
HLE с инструментами56,2%
IFBench82,8%
MRCR v2 256K92,9%
OneMillion-Bench52,5%
HealthBench60,2%
PLawBench73,2%

Мультимодальность, GUI и документы

ТестРезультатТестРезультат
MMMU-Pro82,3%MathVision95,2% без code interpreter
OSWorld-Verified86,1%ScreenSpot Pro84,5%
AndroidWorld85,3%WebArena-Verified66,8%
OmniDocBench 1.592,1%OCR-Bench-V2 EN74,2%
RealWorldQA88,0%CountQA82,4%
VideoMME90,4%VideoMMMU88,7%

Структурированный реестр выше содержит и остальные опубликованные результаты, включая NL2Repo, CoWorkBench, PaperBench, Vision2Web, видео- и OCR-тесты. При сравнении важно сохранять настройки harness: одинаковое название теста не гарантирует одинаковые условия запуска.

Когда выбирать Qwen3.8-Max

Модель рассчитана на сложные coding-задачи, многошаговую работу с инструментами, длинные документы и мультимодальные агентные сценарии. Для более дешёвых массовых запросов стоит сравнить её с Qwen3.7-Plus, а для локального запуска — с моделями, у которых уже подтверждены опубликованные веса и лицензия.

Источники: официальный релиз Qwen3.8-Max от 3 августа 2026 года и официальная карточка Qwen3.8-Max в Alibaba Cloud Model Studio. Данные и цены проверены 10 августа 2026 года.

Где запустить модель

Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.

Обновляем провайдеров и цены…

Стоимость API

$1.65 / $4.951 за 1M токенов в Alibaba Cloud Model Studio; без учёта промо, кэша и batch

Рассчитать сценарий →

Профиль модели

GPQA92.6%SWE Pro67.7%DeepSWE 1.156.6%OSWorld-V86.1%MMMU82.3%

Бенчмарки

Terminal-Bench 2.186.6%
SWE Bench Pro67.7%
DeepSWE 1.156.6%
NL2Repo55.9%
FrontierSWE (Dominance)73.5%
MLS_Bench_Lite41%
PaperBench93%
AndroidBench75.1%
QwenSWEBench80.7%
QwenQoderBench58.4%
QwenReactBench_Elo1724
QwenSVGBench_Elo1713
CoWorkBench (внутренний)74.8%
WorkSpaceBench67.7%
Job Bench53.4%
SkillsBench70.2%
Agents_Last_Exam_Score52.4%
Automation_Bench27.3%
Toolathlon Verified72.5%
WideSearch81.9%
Humanity's Last Exam с инструментами56.2%
GPQA (Экспертные знания)92.6%
Humanity's Last Exam43.6%
IFBench82.8%
OneMillion_Bench52.5%
HealthBench60.2%
PLawBench73.2%
PRBench_Legal57.6%
PRBench_Finance58.3%
MRCR_v2_256k92.9%
LongBench_v266.3%
MMMU Pro (Мультимодальность)82.3%
MathVision95.2%
BabyVision82%
HLE_VL_Tools52.2%
ZeroBench_Sub48.5%
LogicVista91.9%
HiPhO90%
PhyX83.5%
SLAKE90.8%
MedXpertQA-MM80.4%
OSWorld-Verified86.1%
ScreenSpot Pro84.5%
WebArena_Verified66.8%
AndroidWorld85.3%
MobileWorld77.8%
Vision2Web69%
Parametric_CAD_Bench91.5%
OmniDocBench 1.592.1%
OCR-Bench-v2 EN74.2%
OCR-Bench-v2 ZH68.3%
RealWorldQA88%
ERQA77.8%
LingoQA84.8%
SimpleVQA75%
WorldVQA ForceAnswer53.2%
MMStar85.9%
CountQA82.4%
VideoMME90.4%
VideoMMMU88.7%
MMVU82.4%
MLVU90.8%
TVBench81.9%
LVBench81.8%

История семейства

Линейка Qwen

Последовательность собрана по датам релиза моделей Qwen в каталоге. Она показывает соседние поколения, но не приписывает им совместимость или наследование архитектуры без отдельного источника.

Экосистема Qwen3.8-Max

Сервисы, инструменты, материалы и обсуждения, связанные с моделью.

MCP и инструменты

Весь каталог

Точных связей пока нет. Искать по разработчику.

Статьи и термины

Все статьи

Обсуждения о Qwen3.8-Max

Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.

Создать обсуждение