Текущая2026-08-03

От Qwen
Qwen3.8-Max — мультимодальная флагманская MoE-модель Qwen для программирования, длительных агентных задач и работы с текстом, изображениями и видео. В API используется идентификатор qwen3.8-max; модель имеет 2,4 трлн параметров, из которых 95 млрд активны, контекст до 1 млн токенов и поддерживает function calling, structured output, web search, context cache и batch inference.
Qwen3.8-Max сильнее всего выглядит в категориях «рассуждения и следование инструкциям». Профиль рассчитан по процентильным позициям внутри одинаковых тестов; пропуски не считаются нулём. Это навигационная оценка, а не замена тесту на ваших задачах.
Уверенность данных
средняя
Покрытие
14 тестов · 5 направлений
Происхождение
источник не закреплён
3 сопоставимых теста · уверенность: высокая
1 сопоставимых теста · уверенность: низкая
4 сопоставимых теста · уверенность: средняя
3 сопоставимых теста · уверенность: средняя
3 сопоставимых теста · уверенность: средняя
Позиция рассчитана только среди моделей, для которых в каталоге указан результат того же теста. Это помогает сравнивать карточки, но не заменяет проверку модели на вашей задаче.
| Бенчмарк | Результат | Место | Доказательство |
|---|---|---|---|
| Terminal-Bench 2.1 | 86.6% | 1 из 2 | Источник не указан |
| SWE Bench Pro | 67.7% | 1 из 8 | Источник не указан |
| DeepSWE 1.1 | 56.6% | 2 из 3 | Источник не указан |
| NL2Repo | 55.9% | 1 из 4 | Источник не указан |
| FrontierSWE (Dominance) | 73.5% | 2 из 2 | Источник не указан |
| MLS_Bench_Lite | 41% | 1 из 1 | Источник не указан |
| PaperBench | 93% | 1 из 1 | Источник не указан |
| AndroidBench | 75.1% | 1 из 1 | Источник не указан |
| QwenSWEBench | 80.7% | 1 из 1 | Источник не указан |
| QwenQoderBench | 58.4% | 1 из 1 | Источник не указан |
| QwenReactBench_Elo | 1724% | 1 из 1 | Источник не указан |
| QwenSVGBench_Elo | 1713% | 1 из 1 | Источник не указан |
| CoWorkBench (внутренний) | 74.8% | 1 из 3 | Источник не указан |
| WorkSpaceBench | 67.7% | 1 из 1 | Источник не указан |
| Job Bench | 53.4% | 1 из 2 | Источник не указан |
| SkillsBench | 70.2% | 1 из 3 | Источник не указан |
| Agents_Last_Exam_Score | 52.4% | 1 из 1 | Источник не указан |
| Automation_Bench | 27.3% | 1 из 1 | Источник не указан |
| Toolathlon Verified | 72.5% | 2 из 3 | Источник не указан |
| WideSearch | 81.9% | 1 из 1 | Источник не указан |
| Humanity's Last Exam с инструментами | 56.2% | 1 из 3 | Источник не указан |
| GPQA (Экспертные знания) | 92.6% | 4 из 389 | Источник не указан |
| Humanity's Last Exam | 43.6% | 1 из 4 | Источник не указан |
| IFBench | 82.8% | 1 из 3 | Источник не указан |
| OneMillion_Bench | 52.5% | 1 из 1 | Источник не указан |
| HealthBench | 60.2% | 1 из 1 | Источник не указан |
| PLawBench | 73.2% | 1 из 1 | Источник не указан |
| PRBench_Legal | 57.6% | 1 из 1 | Источник не указан |
| PRBench_Finance | 58.3% | 1 из 1 | Источник не указан |
| MRCR_v2_256k | 92.9% | 1 из 1 | Источник не указан |
| LongBench_v2 | 66.3% | 1 из 1 | Источник не указан |
| MMMU Pro (Мультимодальность) | 82.3% | 2 из 6 | Источник не указан |
| MathVision | 95.2% | 1 из 3 | Источник не указан |
| BabyVision | 82% | 1 из 1 | Источник не указан |
| HLE_VL_Tools | 52.2% | 1 из 1 | Источник не указан |
| ZeroBench_Sub | 48.5% | 1 из 1 | Источник не указан |
| LogicVista | 91.9% | 1 из 1 | Источник не указан |
| HiPhO | 90% | 1 из 2 | Источник не указан |
| PhyX | 83.5% | 1 из 1 | Источник не указан |
| SLAKE | 90.8% | 1 из 1 | Источник не указан |
| MedXpertQA-MM | 80.4% | 1 из 2 | Источник не указан |
| OSWorld-Verified | 86.1% | 1 из 4 | Источник не указан |
| ScreenSpot Pro | 84.5% | 1 из 2 | Источник не указан |
| WebArena_Verified | 66.8% | 1 из 1 | Источник не указан |
| AndroidWorld | 85.3% | 1 из 2 | Источник не указан |
| MobileWorld | 77.8% | 1 из 1 | Источник не указан |
| Vision2Web | 69% | 1 из 1 | Источник не указан |
| Parametric_CAD_Bench | 91.5% | 1 из 1 | Источник не указан |
| OmniDocBench 1.5 | 92.1% | 1 из 2 | Источник не указан |
| OCR-Bench-v2 EN | 74.2% | 1 из 2 | Источник не указан |
| OCR-Bench-v2 ZH | 68.3% | 1 из 2 | Источник не указан |
| RealWorldQA | 88% | 1 из 2 | Источник не указан |
| ERQA | 77.8% | 1 из 2 | Источник не указан |
| LingoQA | 84.8% | 1 из 2 | Источник не указан |
| SimpleVQA | 75% | 2 из 2 | Источник не указан |
| WorldVQA ForceAnswer | 53.2% | 2 из 3 | Источник не указан |
| MMStar | 85.9% | 1 из 1 | Источник не указан |
| CountQA | 82.4% | 1 из 2 | Источник не указан |
| VideoMME | 90.4% | 1 из 2 | Источник не указан |
| VideoMMMU | 88.7% | 1 из 2 | Источник не указан |
| MMVU | 82.4% | 1 из 1 | Источник не указан |
| MLVU | 90.8% | 1 из 2 | Источник не указан |
| TVBench | 81.9% | 1 из 2 | Источник не указан |
| LVBench | 81.8% | 1 из 2 | Источник не указан |
Qwen3.8-Max — официальная мультимодальная флагманская модель Qwen, выпущенная 3 августа 2026 года. В API она вызывается как qwen3.8-max. Модель построена как MoE на 2,4 трлн параметров с 95 млрд активных параметров и принимает текст, изображения и видео в контексте до 1 млн токенов.
Модель доступна через Alibaba Cloud Model Studio и QwenCloud. В экосистеме с ней связаны Qwen Studio и Qwen Code; каталог покажет их карточки после штатной публикации. Это не отдельная модель с названием «Qwen 3.8» без суффикса: подтверждённый публичный API-ID относится именно к Max-варианту.
Официальная карточка Model Studio указывает function calling, structured output, web search, context cache и batch inference. Максимальный контекст составляет 1 000 000 токенов, максимальный вход — 991 808 токенов, максимальный вывод — 131 072 токена. Fine-tuning для этой модели не заявлен.
На дату проверки стандартная цена Model Studio составляет $1,65 за 1 млн входных и $4,951 за 1 млн выходных токенов. Акции, batch inference и попадание в context cache могут менять фактическую стоимость, поэтому карточка хранит базовую цену без временных скидок.
Qwen объявила, что открытые веса будут опубликованы через неделю после релиза. До появления отдельной официальной model card с файлами и лицензией каталог не помечает Qwen3.8-Max как Open Source или Open Weights.
Все числа ниже опубликованы самой Qwen Team. Часть тестов выполнена во внутренних harness или на собственных наборах, поэтому их нельзя считать независимым рейтингом.
| Тест | Результат | Условия из релиза |
|---|---|---|
| Terminal-Bench 2.1 | 86,6% | Claude Code, avg@10, лимит 5 часов |
| SWE-bench Pro | 67,7% | Claude Code, контекст 256K |
| DeepSWE 1.1 | 56,6% | лучший результат из двух harness |
| FrontierSWE | 73,5% | mean@5 |
| PaperBench | 93,0% | среднее по трём запускам |
| AndroidBench | 75,1% | avg@3 на публичных 95 задачах |
| SkillsBench | 70,2% | среднее по трём запускам |
| Toolathlon Verified | 72,5% | pass@1 |
| WideSearch | 81,9% | средний item-F1 по четырём запускам |
| Тест | Результат |
|---|---|
| GPQA Diamond | 92,6% |
| HLE | 43,6% |
| HLE с инструментами | 56,2% |
| IFBench | 82,8% |
| MRCR v2 256K | 92,9% |
| OneMillion-Bench | 52,5% |
| HealthBench | 60,2% |
| PLawBench | 73,2% |
| Тест | Результат | Тест | Результат |
|---|---|---|---|
| MMMU-Pro | 82,3% | MathVision | 95,2% без code interpreter |
| OSWorld-Verified | 86,1% | ScreenSpot Pro | 84,5% |
| AndroidWorld | 85,3% | WebArena-Verified | 66,8% |
| OmniDocBench 1.5 | 92,1% | OCR-Bench-V2 EN | 74,2% |
| RealWorldQA | 88,0% | CountQA | 82,4% |
| VideoMME | 90,4% | VideoMMMU | 88,7% |
Структурированный реестр выше содержит и остальные опубликованные результаты, включая NL2Repo, CoWorkBench, PaperBench, Vision2Web, видео- и OCR-тесты. При сравнении важно сохранять настройки harness: одинаковое название теста не гарантирует одинаковые условия запуска.
Модель рассчитана на сложные coding-задачи, многошаговую работу с инструментами, длинные документы и мультимодальные агентные сценарии. Для более дешёвых массовых запросов стоит сравнить её с Qwen3.7-Plus, а для локального запуска — с моделями, у которых уже подтверждены опубликованные веса и лицензия.
Источники: официальный релиз Qwen3.8-Max от 3 августа 2026 года и официальная карточка Qwen3.8-Max в Alibaba Cloud Model Studio. Данные и цены проверены 10 августа 2026 года.
Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.
$1.65 / $4.951 за 1M токенов в Alibaba Cloud Model Studio; без учёта промо, кэша и batch
Рассчитать сценарий →История семейства
Последовательность собрана по датам релиза моделей Qwen в каталоге. Она показывает соседние поколения, но не приписывает им совместимость или наследование архитектуры без отдельного источника.
Сервисы, инструменты, материалы и обсуждения, связанные с моделью.
Точных связей пока нет. Искать по разработчику.
Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.