Текущая2026-05-20

От Qwen
Qwen3.7-Max — проприетарная текстовая флагманская модель Qwen для длительных агентных циклов, программирования и автоматизации рабочих процессов. Она поддерживает контекст до 1 млн токенов, thinking и non-thinking режимы, tool calling и совместимые с OpenAI и Anthropic API. В релизе разработчик публикует более сорока результатов: 60,6% в SWE-Pro, 69,7% в Terminal-Bench 2.0, 92,4% в GPQA Diamond и 96% успешных ускорений в KernelBench L3.
Qwen3.7-Max сильнее всего выглядит в категории «следование инструкциям». Профиль рассчитан по процентилям LiveBench, Artificial Analysis и LMArena; пропуски не считаются нулём.
Показатели G‑Код, G‑Рассуждения, G‑Агенты и G‑Зрение рассчитаны по массовым таблицам LiveBench, Artificial Analysis и LMArena. Наведите или нажмите на значок рядом с оценкой, чтобы увидеть исходный лидерборд, вариант модели, значение и размер выборки.
Уверенность данных
высокая
Покрытие
8 тестов · 8 направлений
Происхождение
livebench
1 тест · уверенность: низкая
1 тест · уверенность: низкая
1 тест · уверенность: низкая
1 тест · уверенность: низкая
1 тест · уверенность: низкая
1 тест · уверенность: низкая
1 тест · уверенность: низкая
1 тест · уверенность: низкая
Место исходного бенчмарка показывается только при закреплённом source record и среди других карточек с источником. Эти старые значения не участвуют в G-Score лидербордов.
| Бенчмарк | Результат | Место | Доказательство |
|---|---|---|---|
| Terminal-Bench 2.0 | 69.7% | 2 из 2 | Результат разработчика |
| SWE-bench Verified | 80.4% | 1 из 2 | Результат разработчика |
| SWE Bench Pro | 60.6% | 1 из 3 | Результат разработчика |
| SWE-Bench Multilingual | 78.3% | 1 из 2 | Результат разработчика |
| NL2Repo | 47.2% | 3 из 4 | Результат разработчика |
| SciCode | 53.5% | 1 из 2 | Результат разработчика |
| QwenWebDev (Elo, внутренний) | 1568 | 1 из 2 | Внутренний тест разработчика |
| QwenSVG (Elo, внутренний) | 1608 | 1 из 2 | Внутренний тест разработчика |
| QwenClawBench | 64.3% | 1 из 2 | Результат разработчика |
| CoWorkBench (внутренний) | 67.2% | 1 из 2 | Внутренний тест разработчика |
| ClawEval | 65.2% | 1 из 2 | Результат разработчика |
| SkillsBench | 59.2% | 1 из 2 | Результат разработчика |
| BFCL v4 (Tool Calling) | 75% | 1 из 2 | Результат разработчика |
| MCP-Mark | 60.8% | 1 из 2 | Результат разработчика |
| MCP Atlas | 76.4% | 2 из 3 | Результат разработчика |
| VITA-Bench | 47.9% | 1 из 2 | Результат разработчика |
| SpreadsheetBench v1 | 87% | 1 из 2 | Результат разработчика |
| KernelBench L3 (задач ускорено) | 96% | 2 из 2 | Результат разработчика |
| Humanity's Last Exam с инструментами | 53.5% | 3 из 3 | Результат разработчика |
| QwenWorldBench (внутренний) | 57.3% | 2 из 2 | Внутренний тест разработчика |
| GPQA (Экспертные знания) | 92.4% | 2 из 3 | Результат разработчика |
| Humanity's Last Exam | 41.4% | 3 из 4 | Результат разработчика |
| LiveCodeBench | 91.6% | 1 из 2 | Результат разработчика |
| HMMT 2026 Feb | 97.1% | 1 из 2 | Результат разработчика |
| IMOAnswerBench | 90% | 1 из 2 | Результат разработчика |
| CritPT | 11.4% | 1 из 2 | Результат разработчика |
| Apex | 44.5% | 1 из 2 | Результат разработчика |
| MMLU-Pro | 89.6% | 1 из 2 | Результат разработчика |
| MMLU-Redux | 95% | 1 из 2 | Результат разработчика |
| SuperGPQA (Сложные вопросы) | 73.6% | 1 из 2 | Результат разработчика |
| IFEval | 94.3% | 2 из 2 | Результат разработчика |
| IFBench | 79.1% | 1 из 2 | Результат разработчика |
| MRCR-v2 128K | 90.4% | 2 из 2 | Результат разработчика |
| WMT24++ | 85.8% | 1 из 2 | Результат разработчика |
| MAXIFE | 89.2% | 1 из 2 | Результат разработчика |
| MMMLU | 90.3% | 1 из 2 | Результат разработчика |
| MMLU-ProX | 87% | 1 из 2 | Результат разработчика |
| NOVA-63 | 59% | 1 из 2 | Результат разработчика |
| INCLUDE | 86.2% | 1 из 2 | Результат разработчика |
| Global PIQA | 91.4% | 1 из 2 | Результат разработчика |
| PolyMATH | 86.5% | 1 из 2 | Результат разработчика |
Происхождение результатов
Результаты перенесены из полной таблицы Qwen Team. В релизе отдельно описаны agent scaffold, лимиты и настройки для основных групп тестов.
Вариант: Qwen3.7-Max, developer evaluation settings from release table · получено 2026-07-22
Qwen3.7-Max — подтверждённый флагман Qwen для агентных задач, представленный 20 мая 2026 года. Модель проприетарная: веса для локального запуска не опубликованы, доступ идёт через Qwen API и Alibaba Cloud Model Studio. Контекст достигает 1 млн токенов, поддерживаются thinking и non-thinking режимы, tool calling и длительные автономные сессии.
3 августа 2026 года Qwen выпустила Qwen3.8-Max — новую мультимодальную флагманскую модель с API-ID qwen3.8-max. Qwen3.7-Max остаётся отдельным текстовым canonical alias; мультимодальные возможности относятся к snapshot qwen3.7-max-2026-06-08, а не автоматически ко всем версиям 3.7-Max.
Модель обучали как основу для long-horizon agents: программирования, MCP-интеграций, офисной автоматизации и последовательностей из сотен или тысяч tool calls. В демонстрации разработчика агент оптимизировал GPU-ядро более 35 часов и выполнил свыше тысячи вызовов инструментов. Это показательный кейс устойчивости, но не независимый бенчмарк.
Все значения ниже получены разработчиком. Внутренние QwenWebDev, QwenSVG, CoWorkBench и QwenWorldBench нельзя напрямую приравнивать к независимым лидербордам.
| Тест | Результат |
|---|---|
| Terminal-Bench 2.0 Terminus | 69,7% |
| SWE-bench Verified | 80,4% |
| SWE-Pro | 60,6% |
| SWE-Multilingual | 78,3% |
| NL2Repo | 47,2% |
| SciCode | 53,5% |
| QwenWebDev | 1568 Elo |
| QwenSVG | 1608 Elo |
| Тест | Результат |
|---|---|
| QwenClawBench | 64,3% |
| CoWorkBench | 67,2% |
| ClawEval | 65,2% |
| SkillsBench | 59,2% |
| BFCL v4 | 75,0% |
| MCP-Mark | 60,8% |
| MCP-Atlas | 76,4% |
| VITA-Bench | 47,9% |
| SpreadsheetBench v1 | 87,0% |
| KernelBench L3 | 1,98× / 96% задач быстрее baseline |
| HLE with tools | 53,5% |
| QwenWorldBench | 57,3% |
| Тест | Результат | Тест | Результат |
|---|---|---|---|
| GPQA Diamond | 92,4% | HLE | 41,4% |
| LiveCodeBench | 91,6% | HMMT 2026 Feb | 97,1% |
| IMOAnswerBench | 90,0% | CritPT | 11,4% |
| Apex | 44,5% | MMLU-Pro | 89,6% |
| MMLU-Redux | 95,0% | SuperGPQA | 73,6% |
| IFEval | 94,3% | IFBench | 79,1% |
| MRCR-v2 128K | 90,4% |
| Тест | Результат | Тест | Результат |
|---|---|---|---|
| WMT24++ | 85,8% | MAXIFE | 89,2% |
| MMMLU | 90,3% | MMLU-ProX | 87,0% |
| NOVA-63 | 59,0% | INCLUDE | 86,2% |
| Global PIQA | 91,4% | PolyMATH | 86,5% |
Глобальная цена snapshot-моделей — $1,65 за 1 млн входных и $4,951 за 1 млн выходных токенов. Для основного alias могут действовать временные дневные и ночные скидки, а кэширование контекста и batch inference меняют итоговую стоимость. В каталоге хранится стабильная list price, а не промо-цена.
Qwen3.7-Max принимает только текст, в отличие от Qwen3.7-Plus. Если агент должен читать скриншоты, управлять GUI, анализировать изображения или видео, Plus функционально подходит лучше и стоит дешевле. Max имеет смысл для наиболее сложного кода, рассуждений и длительных текстовых агентных циклов.
Число параметров и архитектура Qwen3.7-Max не раскрыты. Большая часть сравнений выполнена самой Qwen Team на собственных настройках и местами на внутренних наборах. Контекст 1M также не гарантирует, что модель одинаково хорошо удерживает каждую деталь: важные long-context задачи следует проверять на собственных документах и истории tool calls.
Источники: официальный релиз Qwen3.7, зеркало релиза Alibaba Cloud, официальные цены Model Studio.
Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.
История семейства
Последовательность собрана по датам релиза моделей Qwen в каталоге. Она показывает соседние поколения, но не приписывает им совместимость или наследование архитектуры без отдельного источника.
Сервисы, инструменты, материалы и обсуждения, связанные с моделью.
Точных связей пока нет. Искать по разработчику.
Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.