
От Qwen
Qwen3.7-Max — проприетарная текстовая флагманская модель Qwen для длительных агентных циклов, программирования и автоматизации рабочих процессов. Она поддерживает контекст до 1 млн токенов, thinking и non-thinking режимы, tool calling и совместимые с OpenAI и Anthropic API. В релизе разработчик публикует более сорока результатов: 60,6% в SWE-Pro, 69,7% в Terminal-Bench 2.0, 92,4% в GPQA Diamond и 96% успешных ускорений в KernelBench L3.
Qwen3.7-Max сильнее всего выглядит в категории «рассуждения и код». Индекс 83/100 рассчитан по процентильным позициям в 3 сопоставимых тестах; уверенность — средняя. Это навигационная оценка, а не замена тесту на ваших задачах.
3 сопоставимых теста · уверенность: средняя
2 сопоставимых теста · уверенность: средняя
1 сопоставимых теста · уверенность: низкая
Позиция рассчитана только среди моделей, для которых в каталоге указан результат того же теста. Это помогает сравнивать карточки, но не заменяет проверку модели на вашей задаче.
| Бенчмарк | Результат | Место | Доказательство |
|---|---|---|---|
| Terminal-Bench 2.0 | 69.7% | 2 из 2 | Результат разработчика |
| SWE-bench Verified | 80.4% | 1 из 2 | Результат разработчика |
| SWE Bench Pro | 60.6% | 5 из 7 | Результат разработчика |
| SWE-Bench Multilingual | 78.3% | 1 из 3 | Результат разработчика |
| NL2Repo | 47.2% | 1 из 2 | Результат разработчика |
| SciCode | 53.5% | 1 из 2 | Результат разработчика |
| QwenWebDev (Elo, внутренний) | 1568 | 1 из 2 | Внутренний тест разработчика |
| QwenSVG (Elo, внутренний) | 1608 | 1 из 2 | Внутренний тест разработчика |
| QwenClawBench | 64.3% | 1 из 2 | Результат разработчика |
| CoWorkBench (внутренний) | 67.2% | 1 из 2 | Внутренний тест разработчика |
| ClawEval | 65.2% | 1 из 2 | Результат разработчика |
| SkillsBench | 59.2% | 1 из 2 | Результат разработчика |
| BFCL v4 (Tool Calling) | 75% | 1 из 2 | Результат разработчика |
| MCP-Mark | 60.8% | 1 из 2 | Результат разработчика |
| MCP Atlas | 76.4% | 2 из 3 | Результат разработчика |
| VITA-Bench | 47.9% | 1 из 2 | Результат разработчика |
| SpreadsheetBench v1 | 87% | 1 из 2 | Результат разработчика |
| KernelBench L3 (задач ускорено) | 96% | 2 из 2 | Результат разработчика |
| Humanity's Last Exam с инструментами | 53.5% | 2 из 2 | Результат разработчика |
| QwenWorldBench (внутренний) | 57.3% | 2 из 2 | Внутренний тест разработчика |
| GPQA (Экспертные знания) | 92.4% | 4 из 390 | Результат разработчика |
| Humanity's Last Exam | 41.4% | 2 из 3 | Результат разработчика |
| LiveCodeBench | 91.6% | 1 из 2 | Результат разработчика |
| HMMT 2026 Feb | 97.1% | 1 из 2 | Результат разработчика |
| IMOAnswerBench | 90% | 1 из 2 | Результат разработчика |
| CritPT | 11.4% | 1 из 2 | Результат разработчика |
| Apex | 44.5% | 1 из 2 | Результат разработчика |
| MMLU-Pro | 89.6% | 1 из 2 | Результат разработчика |
| MMLU-Redux | 95% | 1 из 2 | Результат разработчика |
| SuperGPQA (Сложные вопросы) | 73.6% | 1 из 3 | Результат разработчика |
| IFEval | 94.3% | 2 из 2 | Результат разработчика |
| IFBench | 79.1% | 1 из 2 | Результат разработчика |
| MRCR-v2 128K | 90.4% | 2 из 2 | Результат разработчика |
| WMT24++ | 85.8% | 1 из 2 | Результат разработчика |
| MAXIFE | 89.2% | 1 из 2 | Результат разработчика |
| MMMLU | 90.3% | 1 из 2 | Результат разработчика |
| MMLU-ProX | 87% | 1 из 2 | Результат разработчика |
| NOVA-63 | 59% | 1 из 2 | Результат разработчика |
| INCLUDE | 86.2% | 1 из 2 | Результат разработчика |
| Global PIQA | 91.4% | 1 из 2 | Результат разработчика |
| PolyMATH | 86.5% | 1 из 2 | Результат разработчика |
Происхождение результатов
Результаты перенесены из полной таблицы Qwen Team. В релизе отдельно описаны agent scaffold, лимиты и настройки для основных групп тестов.
Вариант: Qwen3.7-Max, developer evaluation settings from release table · получено 2026-07-22
Qwen3.7-Max — подтверждённый флагман Qwen для агентных задач, представленный 20 мая 2026 года. Модель проприетарная: веса для локального запуска не опубликованы, доступ идёт через Qwen API и Alibaba Cloud Model Studio. Контекст достигает 1 млн токенов, поддерживаются thinking и non-thinking режимы, tool calling и длительные автономные сессии.
На дату обновления каталога официальной Qwen3.8 нет ни в списке моделей Alibaba Cloud, ни на сайте Qwen, ни в репозиториях команды. Последняя подтверждённая коммерческая серия — Qwen3.7: текстовая Qwen3.7-Max и мультимодальная Qwen3.7-Plus. Поэтому создавать карточку Qwen3.8 по слухам было бы неправильно.
Модель обучали как основу для long-horizon agents: программирования, MCP-интеграций, офисной автоматизации и последовательностей из сотен или тысяч tool calls. В демонстрации разработчика агент оптимизировал GPU-ядро более 35 часов и выполнил свыше тысячи вызовов инструментов. Это показательный кейс устойчивости, но не независимый бенчмарк.
Все значения ниже получены разработчиком. Внутренние QwenWebDev, QwenSVG, CoWorkBench и QwenWorldBench нельзя напрямую приравнивать к независимым лидербордам.
| Тест | Результат |
|---|---|
| Terminal-Bench 2.0 Terminus | 69,7% |
| SWE-bench Verified | 80,4% |
| SWE-Pro | 60,6% |
| SWE-Multilingual | 78,3% |
| NL2Repo | 47,2% |
| SciCode | 53,5% |
| QwenWebDev | 1568 Elo |
| QwenSVG | 1608 Elo |
| Тест | Результат |
|---|---|
| QwenClawBench | 64,3% |
| CoWorkBench | 67,2% |
| ClawEval | 65,2% |
| SkillsBench | 59,2% |
| BFCL v4 | 75,0% |
| MCP-Mark | 60,8% |
| MCP-Atlas | 76,4% |
| VITA-Bench | 47,9% |
| SpreadsheetBench v1 | 87,0% |
| KernelBench L3 | 1,98× / 96% задач быстрее baseline |
| HLE with tools | 53,5% |
| QwenWorldBench | 57,3% |
| Тест | Результат | Тест | Результат |
|---|---|---|---|
| GPQA Diamond | 92,4% | HLE | 41,4% |
| LiveCodeBench | 91,6% | HMMT 2026 Feb | 97,1% |
| IMOAnswerBench | 90,0% | CritPT | 11,4% |
| Apex | 44,5% | MMLU-Pro | 89,6% |
| MMLU-Redux | 95,0% | SuperGPQA | 73,6% |
| IFEval | 94,3% | IFBench | 79,1% |
| MRCR-v2 128K | 90,4% |
| Тест | Результат | Тест | Результат |
|---|---|---|---|
| WMT24++ | 85,8% | MAXIFE | 89,2% |
| MMMLU | 90,3% | MMLU-ProX | 87,0% |
| NOVA-63 | 59,0% | INCLUDE | 86,2% |
| Global PIQA | 91,4% | PolyMATH | 86,5% |
Глобальная цена snapshot-моделей — $1,65 за 1 млн входных и $4,951 за 1 млн выходных токенов. Для основного alias могут действовать временные дневные и ночные скидки, а кэширование контекста и batch inference меняют итоговую стоимость. В каталоге хранится стабильная list price, а не промо-цена.
Qwen3.7-Max принимает только текст, в отличие от Qwen3.7-Plus. Если агент должен читать скриншоты, управлять GUI, анализировать изображения или видео, Plus функционально подходит лучше и стоит дешевле. Max имеет смысл для наиболее сложного кода, рассуждений и длительных текстовых агентных циклов.
Число параметров и архитектура Qwen3.7-Max не раскрыты. Большая часть сравнений выполнена самой Qwen Team на собственных настройках и местами на внутренних наборах. Контекст 1M также не гарантирует, что модель одинаково хорошо удерживает каждую деталь: важные long-context задачи следует проверять на собственных документах и истории tool calls.
Источники: официальный релиз Qwen3.7, зеркало релиза Alibaba Cloud, официальные цены Model Studio.
Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.
$1.65 / $4.951 за 1M токенов; доступны скидки на кэш и batch
Сервисы, инструменты, материалы и обсуждения, связанные с моделью.
Откройте результаты по названию модели и проверьте актуальную интеграцию.
Точных связей пока нет. Искать по разработчику.
Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.