Текущая2026-08-03

От Qwen
Qwen3.8-Max — мультимодальная флагманская MoE-модель Qwen для программирования, длительных агентных задач и работы с текстом, изображениями и видео. В API используется идентификатор qwen3.8-max; модель имеет 2,4 трлн параметров, из которых 95 млрд активны, контекст до 1 млн токенов и поддерживает function calling, structured output, web search, context cache и batch inference.
Qwen3.8-Max сильнее всего выглядит в категориях «агенты и зрение». Профиль рассчитан по процентилям LiveBench, Artificial Analysis и LMArena; пропуски не считаются нулём.
Показатели G‑Код, G‑Рассуждения, G‑Агенты и G‑Зрение рассчитаны по массовым таблицам LiveBench, Artificial Analysis и LMArena. Наведите или нажмите на значок рядом с оценкой, чтобы увидеть исходный лидерборд, вариант модели, значение и размер выборки.
Уверенность данных
высокая
Покрытие
10 тестов · 9 направлений
Происхождение
livebench + artificialAnalysis + lmarenaVision
1 тест · уверенность: низкая
1 тест · уверенность: средняя
2 теста · уверенность: средняя
1 тест · уверенность: низкая
1 тест · уверенность: низкая
1 тест · уверенность: низкая
1 тест · уверенность: низкая
1 тест · уверенность: низкая
1 тест · уверенность: низкая
Место исходного бенчмарка показывается только при закреплённом source record и среди других карточек с источником. Эти старые значения не участвуют в G-Score лидербордов.
| Бенчмарк | Результат | Место | Доказательство |
|---|---|---|---|
| Terminal-Bench 2.1 | 86.6% | н/д | Источник не указан |
| SWE Bench Pro | 67.7% | н/д | Источник не указан |
| DeepSWE 1.1 | 56.6% | н/д | Источник не указан |
| NL2Repo | 55.9% | н/д | Источник не указан |
| FrontierSWE (Dominance) | 73.5% | н/д | Источник не указан |
| MLS_Bench_Lite | 41% | н/д | Источник не указан |
| PaperBench | 93% | н/д | Источник не указан |
| AndroidBench | 75.1% | н/д | Источник не указан |
| QwenSWEBench | 80.7% | н/д | Источник не указан |
| QwenQoderBench | 58.4% | н/д | Источник не указан |
| QwenReactBench_Elo | 1724 | н/д | Источник не указан |
| QwenSVGBench_Elo | 1713 | н/д | Источник не указан |
| CoWorkBench (внутренний) | 74.8% | н/д | Источник не указан |
| WorkSpaceBench | 67.7% | н/д | Источник не указан |
| Job Bench | 53.4% | н/д | Источник не указан |
| SkillsBench | 70.2% | н/д | Источник не указан |
| Agents_Last_Exam_Score | 52.4% | н/д | Источник не указан |
| Automation_Bench | 27.3% | н/д | Источник не указан |
| Toolathlon Verified | 72.5% | н/д | Источник не указан |
| WideSearch | 81.9% | н/д | Источник не указан |
| Humanity's Last Exam с инструментами | 56.2% | н/д | Источник не указан |
| GPQA (Экспертные знания) | 92.6% | н/д | Источник не указан |
| Humanity's Last Exam | 43.6% | н/д | Источник не указан |
| IFBench | 82.8% | н/д | Источник не указан |
| OneMillion_Bench | 52.5% | н/д | Источник не указан |
| HealthBench | 60.2% | н/д | Источник не указан |
| PLawBench | 73.2% | н/д | Источник не указан |
| PRBench_Legal | 57.6% | н/д | Источник не указан |
| PRBench_Finance | 58.3% | н/д | Источник не указан |
| MRCR_v2_256k | 92.9% | н/д | Источник не указан |
| LongBench_v2 | 66.3% | н/д | Источник не указан |
| MMMU Pro (Мультимодальность) | 82.3% | н/д | Источник не указан |
| MathVision | 95.2% | н/д | Источник не указан |
| BabyVision | 82% | н/д | Источник не указан |
| HLE_VL_Tools | 52.2% | н/д | Источник не указан |
| ZeroBench_Sub | 48.5% | н/д | Источник не указан |
| LogicVista | 91.9% | н/д | Источник не указан |
| HiPhO | 90% | н/д | Источник не указан |
| PhyX | 83.5% | н/д | Источник не указан |
| SLAKE | 90.8% | н/д | Источник не указан |
| MedXpertQA-MM | 80.4% | н/д | Источник не указан |
| OSWorld-Verified | 86.1% | н/д | Источник не указан |
| ScreenSpot Pro | 84.5% | н/д | Источник не указан |
| WebArena_Verified | 66.8% | н/д | Источник не указан |
| AndroidWorld | 85.3% | н/д | Источник не указан |
| MobileWorld | 77.8% | н/д | Источник не указан |
| Vision2Web | 69% | н/д | Источник не указан |
| Parametric_CAD_Bench | 91.5% | н/д | Источник не указан |
| OmniDocBench 1.5 | 92.1% | н/д | Источник не указан |
| OCR-Bench-v2 EN | 74.2% | н/д | Источник не указан |
| OCR-Bench-v2 ZH | 68.3% | н/д | Источник не указан |
| RealWorldQA | 88% | н/д | Источник не указан |
| ERQA | 77.8% | н/д | Источник не указан |
| LingoQA | 84.8% | н/д | Источник не указан |
| SimpleVQA | 75% | н/д | Источник не указан |
| WorldVQA ForceAnswer | 53.2% | н/д | Источник не указан |
| MMStar | 85.9% | н/д | Источник не указан |
| CountQA | 82.4% | н/д | Источник не указан |
| VideoMME | 90.4% | н/д | Источник не указан |
| VideoMMMU | 88.7% | н/д | Источник не указан |
| MMVU | 82.4% | н/д | Источник не указан |
| MLVU | 90.8% | н/д | Источник не указан |
| TVBench | 81.9% | н/д | Источник не указан |
| LVBench | 81.8% | н/д | Источник не указан |
Qwen3.8-Max — официальная мультимодальная флагманская модель Qwen, выпущенная 3 августа 2026 года. В API она вызывается как qwen3.8-max. Модель построена как MoE на 2,4 трлн параметров с 95 млрд активных параметров и принимает текст, изображения и видео в контексте до 1 млн токенов.
Модель доступна через Alibaba Cloud Model Studio и QwenCloud. В экосистеме с ней связаны Qwen Studio и Qwen Code; каталог покажет их карточки после штатной публикации. Это не отдельная модель с названием «Qwen 3.8» без суффикса: подтверждённый публичный API-ID относится именно к Max-варианту.
Официальная карточка Model Studio указывает function calling, structured output, web search, context cache и batch inference. Максимальный контекст составляет 1 000 000 токенов, максимальный вход — 991 808 токенов, максимальный вывод — 131 072 токена. Fine-tuning для этой модели не заявлен.
На дату проверки стандартная цена Model Studio составляет $1,65 за 1 млн входных и $4,951 за 1 млн выходных токенов. Акции, batch inference и попадание в context cache могут менять фактическую стоимость, поэтому карточка хранит базовую цену без временных скидок.
Qwen объявила, что открытые веса будут опубликованы через неделю после релиза. До появления отдельной официальной model card с файлами и лицензией каталог не помечает Qwen3.8-Max как Open Source или Open Weights.
Все числа ниже опубликованы самой Qwen Team. Часть тестов выполнена во внутренних harness или на собственных наборах, поэтому их нельзя считать независимым рейтингом.
| Тест | Результат | Условия из релиза |
|---|---|---|
| Terminal-Bench 2.1 | 86,6% | Claude Code, avg@10, лимит 5 часов |
| SWE-bench Pro | 67,7% | Claude Code, контекст 256K |
| DeepSWE 1.1 | 56,6% | лучший результат из двух harness |
| FrontierSWE | 73,5% | mean@5 |
| PaperBench | 93,0% | среднее по трём запускам |
| AndroidBench | 75,1% | avg@3 на публичных 95 задачах |
| SkillsBench | 70,2% | среднее по трём запускам |
| Toolathlon Verified | 72,5% | pass@1 |
| WideSearch | 81,9% | средний item-F1 по четырём запускам |
| Тест | Результат |
|---|---|
| GPQA Diamond | 92,6% |
| HLE | 43,6% |
| HLE с инструментами | 56,2% |
| IFBench | 82,8% |
| MRCR v2 256K | 92,9% |
| OneMillion-Bench | 52,5% |
| HealthBench | 60,2% |
| PLawBench | 73,2% |
| Тест | Результат | Тест | Результат |
|---|---|---|---|
| MMMU-Pro | 82,3% | MathVision | 95,2% без code interpreter |
| OSWorld-Verified | 86,1% | ScreenSpot Pro | 84,5% |
| AndroidWorld | 85,3% | WebArena-Verified | 66,8% |
| OmniDocBench 1.5 | 92,1% | OCR-Bench-V2 EN | 74,2% |
| RealWorldQA | 88,0% | CountQA | 82,4% |
| VideoMME | 90,4% | VideoMMMU | 88,7% |
Структурированный реестр выше содержит и остальные опубликованные результаты, включая NL2Repo, CoWorkBench, PaperBench, Vision2Web, видео- и OCR-тесты. При сравнении важно сохранять настройки harness: одинаковое название теста не гарантирует одинаковые условия запуска.
Модель рассчитана на сложные coding-задачи, многошаговую работу с инструментами, длинные документы и мультимодальные агентные сценарии. Для более дешёвых массовых запросов стоит сравнить её с Qwen3.7-Plus, а для локального запуска — с моделями, у которых уже подтверждены опубликованные веса и лицензия.
Источники: официальный релиз Qwen3.8-Max от 3 августа 2026 года и официальная карточка Qwen3.8-Max в Alibaba Cloud Model Studio. Данные и цены проверены 10 августа 2026 года.
Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.
$1.65 / $4.951 за 1M токенов в Alibaba Cloud Model Studio; без учёта промо, кэша и batch
Рассчитать сценарий →История семейства
Последовательность собрана по датам релиза моделей Qwen в каталоге. Она показывает соседние поколения, но не приписывает им совместимость или наследование архитектуры без отдельного источника.
Сервисы, инструменты, материалы и обсуждения, связанные с моделью.
Точных связей пока нет. Искать по разработчику.
Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.