Текущая2026-09-02

От Qwen
Qwen3.8-Max-0902 — датированный снимок флагманской API-модели Alibaba с улучшениями в разработке, долгих агентных задачах и мультимодальном восприятии. Он принимает текст, изображения и видео, возвращает текст, поддерживает контекст 1M, ответ до 131K и до 262K reasoning-токенов. Это отдельная фиксированная версия, а не новый набор открытых весов.
Для Qwen3.8-Max-0902 пока нет совпавших результатов в подключённых публичных лидербордах. Исходные значения карточки не используются для G‑Score.
Показатели G‑Код, G‑Рассуждения, G‑Агенты и G‑Зрение рассчитаны по массовым таблицам LiveBench, Artificial Analysis и LMArena. Наведите или нажмите на значок рядом с оценкой, чтобы увидеть исходный лидерборд, вариант модели, значение и размер выборки.
Уверенность данных
низкая
Покрытие
0 тестов · 0 направлений
Происхождение
нет данных лидербордов
Место исходного бенчмарка показывается только при закреплённом source record и среди других карточек с источником. Эти старые значения не участвуют в G-Score лидербордов.
| Бенчмарк | Результат | Место | Доказательство |
|---|---|---|---|
| Terminal-Bench 2.1 | 86.6% | 4 из 9 | Результат разработчика |
| SWE Bench Pro | 67.7% | 1 из 8 | Результат разработчика |
| DeepSWE 1.1 | 56.6% | 7 из 7 | Результат разработчика |
| PaperBench | 93% | 1 из 1 | Внутренний тест разработчика |
| CoWorkBench (внутренний) | 74.8% | 1 из 4 | Внутренний тест разработчика |
| Toolathlon Verified | 72.5% | 7 из 8 | Результат разработчика |
| IFBench | 82.8% | 1 из 4 | Результат разработчика |
| MRCR v2 256K, 8 needles | 92.9% | 1 из 1 | Результат разработчика |
Происхождение результатов
Цифры описывают семейство Qwen3.8-Max и не доказывают отдельный прирост snapshot 0902. Сравнения зависят от Claude Code, mini-SWE-agent и других указанных Qwen harness; внутренние CoWorkBench и PaperBench не являются независимыми лидербордами.
Вариант: Qwen3.8-Max family; no separate 0902 benchmark table published · получено 2026-09-07
Qwen3.8-Max-0902 — датированный снимок облачного флагмана Alibaba от 2 сентября 2026 года. Его стоит выбирать, когда приложению нужна воспроизводимая версия модели для регрессионных тестов, аудита и стабильного поведения. Модель принимает текст, изображения и видео, отвечает текстом, поддерживает контекст 1 млн токенов, управляемое thinking и инструменты. При этом Alibaba не опубликовала отдельную таблицу тестов именно для 0902: доступные официальные результаты относятся к базовому Qwen3.8-Max.
В документации встречаются три близких идентификатора, и у них разная роль.
| Идентификатор | Что означает | Когда использовать |
|---|---|---|
qwen3.8-max-0902 | Фиксированный снимок от 2 сентября 2026 года | Продакшен с регрессионными тестами, повторяемые эксперименты, аудит |
qwen3.8-max-2026-09-02 | Официальный alias того же снимка 0902 | Если в конфигурации удобнее полная дата |
qwen3.8-max | Базовый сервисный ID семейства Max | Когда команда готова принимать развитие управляемой модели и проверять изменения |
Alibaba называет 0902 улучшенным снимком qwen3.8-max, но не утверждает на изученных страницах, что базовый ID уже всегда эквивалентен 0902. Поэтому закрепление qwen3.8-max-0902 — более надёжный выбор для тестируемой сборки. Базовый ID подходит для экспериментов и продуктов, где важнее получать обновления, чем сохранять прежние ответы побайтно.
Для 0902 заявлены улучшения в крупных инженерных проектах, долгих автономных coding-сессиях, совместной работе агентов и оркестрации нескольких инструментов. Также доработано зрительное понимание графиков, документов и смешанного мультимодального контекста. Это описание разработчика без опубликованной величины прироста.
Базовый Qwen3.8-Max описан как Mixture of Experts (MoE): 2,4 трлн параметров всего и около 95 млрд активных при обработке токена. Qwen связывает управляемый Max с открытой Qwen3.8-2.4T-A95B, но у снимка 0902 нет отдельного раскрытия архитектуры. Значит, эти числа характеризуют линию Max, а не новую архитектуру 0902. Сам снимок не является отдельной публикацией открытых весов.
Qwen3.8-Max-0902 принимает текст, изображения и видео, а возвращает только текст. Она может анализировать скриншот интерфейса, диаграмму, страницы документа или видеоматериал, но не генерирует новое изображение или видео как медиамодель.
Официальные лимиты точнее маркетингового обозначения «1M»:
Эти максимумы нельзя механически складывать. Alibaba предупреждает, что доступная длина меняется при разных сочетаниях параметров API. Миллионный контекст позволяет передать большой репозиторий или набор документов, но не гарантирует одинаковую точность на любой позиции. Перед внедрением полезно проверить поиск нужных фрагментов, задержку и стоимость на реальных данных.
Снимок поддерживает гибридный режим: thinking включён по умолчанию, но его можно отключить для простых запросов. Уровень reasoning_effort принимает low, medium и xhigh; они соответствуют бюджетам до 4 096, 16 384 и 262 144 токенов рассуждения. reasoning_effort и thinking_budget нельзя передавать одновременно.
Параметр preserve_thinking сохраняет reasoning между ходами и для 0902 включён по умолчанию. Исторический reasoning_content нужно возвращать в отдельном поле, а не добавлять к обычному content. Эти токены входят в оплачиваемый input, поэтому длинный агент может дорожать даже при коротких видимых сообщениях.
Модель поддерживает function calling, структурированный JSON, prefix completion, context cache и web search. На QwenCloud встроенные code interpreter, web search, web extractor и поиск изображений доступны через Responses API. Набор зависит от платформы и региона: таблица Model Studio для снимка помечает Batch inference и fine-tuning как неподдерживаемые. Для терминальной разработки модель можно подключать через Qwen Code, а ручные задачи и проверку промптов проводить в Qwen Studio.
На 7 сентября 2026 года QwenCloud публикует такие ставки:
| Операция | Цена за 1 млн токенов |
|---|---|
| Обычный вход | $2,00 |
| Выход | $6,00 |
| Вход при implicit cache hit | $0,25 |
| Создание explicit cache | $2,50 |
| Чтение explicit cache | $0,17 |
Implicit cache выгоден, когда запросы автоматически повторяют длинный неизменный префикс. Explicit cache требует отдельной платы за создание, зато чтение дешевле: он подходит для системного промпта, базы правил или корпуса документов, которые используются многократно. Изменение префикса может привести к промаху кэша.
Это тариф QwenCloud, а не универсальная цена любого API-канала. В Alibaba Cloud Model Studio ставки публикуются по регионам и в юанях, а акции могут отличаться от базовой таблицы. При работе через OpenRouter нужно проверять цену, контекст, инструменты и провайдера маршрута отдельно.
Отдельных чисел для Qwen3.8-Max-0902 разработчик не опубликовал. Таблица ниже относится к Qwen3.8-Max и показывает уровень исходной линии, но не доказывает улучшение сентябрьского снимка.
| Тест и версия | Qwen3.8-Max | Условия Qwen |
|---|---|---|
| Terminal-Bench 2.1 | 86,6 | Claude Code, avg@10, лимит 5 часов, max_tokens=131072 |
| SWE-bench Pro | 67,7 | Claude Code, temperature 1,0, top_p 0,95, контекст 256K, исправленный набор |
| DeepSWE 1.1 | 56,6 | лучший результат из Claude Code и mini-SWE-agent, контекст 256K |
| PaperBench | 93,0 | BasicAgent в Code-Dev, судья Claude Opus 4.6, среднее трёх запусков |
| CoWorkBench | 74,8 | внутренний тест Qwen для долгих профессиональных задач |
| Toolathlon Verified | 72,5 | pass@1 |
| IFBench | 82,8 | официальная оценка Qwen |
| MRCR v2 256K, 8-needle | 92,9 | проверка длинного контекста 256K |
Результаты получены не по единому протоколу. Часть наборов принадлежит Qwen, в других используются разные агентные оболочки и модели-судьи. Их разумно применять для формирования shortlist, а окончательный выбор делать по собственным репозиториям, инструментам, языкам и ограничениям времени.
0902 интересен для анализа крупного репозитория, исправления связанных ошибок, генерации нескольких файлов и автономного цикла «план — инструменты — проверка». Снимок особенно полезен, если команда хранит golden-набор задач и не хочет, чтобы смена модели смешивалась с изменениями агента. Однако высокие официальные баллы не заменяют тесты на вашей сборке, терминале и правилах доступа.
Function calling и structured outputs позволяют строить процессы с несколькими API. Thinking помогает в планировании, а сохранение reasoning — в длинной сессии. Контролируйте лимиты шагов, разрешения инструментов, повторные вызовы и стоимость истории. Модель может ошибиться в выборе функции или аргумента, поэтому необратимые действия требуют внешней проверки.
Мультимодальный вход подходит для разбора интерфейсов, таблиц, схем, сканов и длинных видео. Улучшение vision для 0902 заявлено качественно, без отдельного benchmark-пакета. Для критичных OCR-, финансовых или юридических задач нужны контрольные примеры и сверка извлечённых фактов с оригиналом.
Выбирайте 0902, если важны фиксированный ID, повторяемость и управляемый выпуск обновлений. Оставляйте qwen3.8-max, если готовы регулярно прогонять eval-набор и хотите следовать развитию базового сервиса. Экономичный поток простых запросов лучше отделить от дорогих сложных задач: отключать thinking там, где оно не даёт пользы, применять кэш и маршрутизировать запросы по сложности.
Главные ограничения снимка — закрытый управляемый API, отсутствие отдельной количественной оценки прироста 0902, только текстовый выход и зависимость функций от endpoint и региона. Контекст 1M также увеличивает задержку и счёт, а сохранённое reasoning тарифицируется как вход.
Нет. Alibaba называет qwen3.8-max-2026-09-02 alias снимка qwen3.8-max-0902.
Для критичного приложения не стоит. Базовый ID не даёт той же явной фиксации версии, поэтому сначала прогоните регрессионный набор.
Да. Это гибридная модель: thinking включён по умолчанию, но enable_thinking=false отключает его для простых запросов.
Нет. Изображения и видео поддерживаются на входе для анализа, выход модели — текст.
Не следует так рассчитывать. Максимальный вход ниже 1M, а доступная длина зависит от режима и параметров; контекст и вывод используют общий лимит запроса.
В изученных первичных источниках отдельной таблицы нет. Опубликованные числа относятся к Qwen3.8-Max и служат ориентиром семейства.
Таблица Alibaba Cloud Model Studio помечает обе функции как неподдерживаемые для 0902. Возможности QwenCloud и других каналов нужно проверять по конкретному endpoint.
Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.
$2.00 / $6.00 за 1M токенов; implicit cache $0.25, explicit cache read $0.17
Рассчитать сценарий →Для диаграммы пока недостаточно сопоставимых тестов.
История семейства
Последовательность собрана по датам релиза моделей Qwen в каталоге. Она показывает соседние поколения, но не приписывает им совместимость или наследование архитектуры без отдельного источника.
Сервисы, инструменты, материалы и обсуждения, связанные с моделью.
Откройте результаты по названию модели и проверьте актуальную интеграцию.
Точных связей пока нет. Искать по разработчику.
Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.