К списку моделей
Логотип Qwen, разработчика Qwen3.8-Flash-Next

Qwen3.8-Flash-Next

G-Score: н/д

От Qwen

Open Weights
FAMQwen
CTX256K нативно / до 1M
PAR125B + 51B n-gram embeddings / 6B активных
Релиз: 2026-08-26
PreviewFlashMoEOpen WeightsMultimodalCodeReasoningAgentic

Краткое описание

Qwen3.8-Flash-Next — открытый мультимодальный MoE-preview архитектуры, которую Qwen исследует для будущего Qwen4. Основная модель имеет 125 млрд параметров, ещё 51 млрд находятся в n-gram embeddings, а на токен активируется около 6 млрд. Нативный контекст — 262 144 токена с расширением до 1M; веса опубликованы по Qwen Community License 1.0.

G-Score и профиль

G-Score: н/д

Для Qwen3.8-Flash-Next пока нет совпавших результатов в подключённых публичных лидербордах. Исходные значения карточки не используются для G‑Score.

Показатели G‑Код, G‑Рассуждения, G‑Агенты и G‑Зрение рассчитаны по массовым таблицам LiveBench, Artificial Analysis и LMArena. Наведите или нажмите на значок рядом с оценкой, чтобы увидеть исходный лидерборд, вариант модели, значение и размер выборки.

Уверенность данных

низкая

Покрытие

0 тестов · 0 направлений

Происхождение

нет данных лидербордов

Как рассчитан профиль →

Место модели в каталоге

Место исходного бенчмарка показывается только при закреплённом source record и среди других карточек с источником. Эти старые значения не участвуют в G-Score лидербордов.

БенчмаркРезультатМестоДоказательство
DeepSWE 1.158.7%6 из 7Результат разработчика
SWE Bench Pro62.5%3 из 8Результат разработчика
SWE-Bench Multilingual81%2 из 5Результат разработчика
NL2Repo48.1%6 из 8Результат разработчика
CoWorkBench (внутренний)73.9%2 из 4Внутренний тест разработчика
Job Bench55.7%1 из 2Результат разработчика
Toolathlon Verified73.5%5 из 8Результат разработчика
GPQA Diamond91.7%3 из 3Результат разработчика
IFBench81.3%2 из 4Результат разработчика
Humanity's Last Exam35.9%6 из 7Результат разработчика
LiveCodeBench91.9%1 из 4Результат разработчика
RecreationBench49.9%1 из 1Внутренний тест разработчика
AndroidWorld84.5%1 из 2Результат разработчика
Vision2Web64%1 из 1Внутренний тест разработчика
RealWorldQA88.5%1 из 2Результат разработчика
ERQA72.3%1 из 2Результат разработчика
LVBench76.6%1 из 2Результат разработчика

Происхождение результатов

Результаты опубликованы Qwen и не воспроизводились независимо. Coding и agentic строки используют разные harness, turn budgets, judges и ограничения; прогон на 256K не доказывает качество YaRN при 1M.

Вариант: Qwen/Qwen3.8-Flash-Next post-trained open-weight checkpoint · получено 2026-09-07

Подробный обзор модели

Qwen3.8-Flash-Next — мультимодальная MoE-модель Alibaba с открытыми весами и архитектурой будущего Qwen4. Она принимает текст, изображения и видео, нативно держит 262 144 токена и расширяется до 1 млн. Главный компромисс: активны лишь 6 млрд параметров, но BF16-checkpoint занимает около 335 GiB, поэтому нужен многопроцессорный сервер.

Что именно открыла Qwen

Flash-Next — post-trained checkpoint Qwen/Qwen3.8-Flash-Next на Hugging Face, а не только исследовательская base-модель. Его основная языковая часть содержит 125 млрд параметров, из которых на токен активируются 6 млрд. Отдельно указаны 51 млрд параметров n-gram embeddings и 4 млрд параметров MTP — модуля предсказания нескольких следующих токенов. Размер репозитория с BF16-весами составляет около 360 GB, или 335,28 GiB по рецепту vLLM.

Модель имеет 48 слоёв и 512 экспертов: маршрутизатор выбирает 10, плюс работает один общий эксперт. Это объясняет низкий объём вычислений на токен, но не превращает checkpoint в «модель на 6B»: хранить и распределять между устройствами приходится гораздо больше весов.

Qwen Community License 1.0 разрешает использовать, изменять, дообучать и распространять производные версии. Продукты крупнее 100 млн активных пользователей в месяц или $20 млн месячной выручки должны заметно показывать имя модели. Для коммерческого Model-as-a-Service и самостоятельного AI-ассистента для кода или офисной работы требуется отдельная лицензия Qwen. Поэтому «open-weight» здесь точнее, чем безоговорочное «open source».

Как устроена архитектура Flash-Next

В 48 слоях повторяется схема: три слоя Gated DeltaNet, затем один слой Qwen Sparse Attention. Gated DeltaNet сжимает прошлый контекст в компактное состояние и дешёво ведёт последовательность. QSA возвращает выборочный доступ к полной истории: лёгкий индексатор оценивает не отдельные токены, а микроблоки и передаёт вниманию наиболее важные участки. Такая пара рассчитана на длинные агентные сессии, где нужно одновременно помнить общий ход работы и точно извлекать старые детали.

Gated Residual расширяет residual stream до четырёх ветвей. Динамический gate управляет чтением, а скалярный gate — записью по ветвям. N-gram Embedding на втором слое адресует таблицы по биграммам и триграммам; эти 51 млрд параметров добавляют ёмкость без сопоставимого роста матричных вычислений и могут храниться в оперативной памяти с асинхронной подгрузкой. Технический отчёт предупреждает: уменьшение loss при увеличении n-gram-словаря не всегда даёт такой же рост downstream-качества.

MTP означает Multi-Token Prediction. Однослойный модуль обучен предсказывать несколько шагов и может служить draft-моделью для speculative decoding. Но ускорение не гарантировано: в опубликованном рецепте vLLM на четырёх H100 принятие speculative-токенов было около 36%, а throughput с MTP оказался на 8–36% ниже. Опцию нужно проверять на своём железе и профиле запросов.

Контекст, модальности и reasoning

Нативное окно равно 262 144 токенам. До 1 000 000 его расширяют статическим YaRN с коэффициентом 4; для типичных 524 288 токенов Qwen рекомендует коэффициент 2. Статическое масштабирование действует и на короткие запросы, поэтому может ухудшить их качество. Миллионный режим стоит включать только для отдельного длинноконтекстного профиля и проверять извлечение из начала, середины и конца.

Flash-Next принимает текст, изображения и видео, но генерирует текст. Это подходит для анализа скриншотов, диаграмм, интерфейсов и длинных роликов. Аудиовход и генерация медиа не заявлены. Для часового видео растут visual-токены, KV-cache, задержка и требования к памяти — сама поддержка формата ещё не означает дешёвый запуск.

Thinking включён по умолчанию. Его можно отключить через enable_thinking=false, сохранить рассуждения между ходами через preserve_thinking и выбрать reasoning_effort: low, medium или xhigh. Для локального API нужны совместимые reasoning- и tool-call-парсеры. Модель умеет формировать вызовы функций, но поиск, интерпретатор и другие инструменты предоставляет ваш оркестратор. Для работы с репозиториями её можно подключить к Qwen Code.

Что требуется для локального запуска

Официально перечислены Transformers, SGLang, vLLM и TokenSpeed; llama.cpp поддерживает GGUF для текста и зрения, MLX-VLM — Apple Silicon. Простой transformers serve полезен для проверки совместимости, а production-serving лучше строить на специализированном движке.

Практические ориентиры vLLM показывают масштаб задачи:

  • FP8-checkpoint занимает 172,78 GiB; BF16 — 335,28 GiB;
  • для FP8 проверен минимум из двух GB300, рекомендованы четыре;
  • для четырёх H100 80 GB таблицу n-gram embeddings нужно выгружать в CPU RAM;
  • под offload требуется не менее 51 GB оперативной памяти плюс запас движку;
  • pipeline parallelism и XPU/TPU начальной реализацией не поддерживаются.

MoE экономит вычисления, однако длинный контекст всё равно раздувает KV-cache. Начинайте с меньшего max-model-len, измеряйте пиковую память на реальных изображениях и видео, затем увеличивайте параллелизм. У открытых весов нет тарифа за токен, но сервер, хранение, трафик и сопровождение оплачивает владелец.

Бенчмарки и их ограничения

ТестQwen3.8-Flash-NextЧто важно учесть
DeepSWE 1.158,7лучший результат из двух harness: Claude Code и mini-SWE-agent; 256K
SWE-bench Pro62,5Claude Code; исправленный набор; все baseline перезапущены
SWE-bench Multilingual81,0mini-SWE-agent; 256K
NL2Repo-Bench48,1Claude Code; запрещены команды скачивания целевого репозитория
CoWorkBench73,9внутренний тест Qwen на долгие офисные задачи
Toolathlon Verified73,5 pass@1использование инструментов в реальных сценариях
GPQA Diamond91,7научные вопросы
LiveCodeBench v691,9соревновательное программирование
OSWorld 2.019,4 binary / 52,3 partialполное выполнение и частичная награда — разные метрики
LVBench76,6понимание длинного видео

В coding-тестах Qwen использовала temperature=1.0, top_p=0.95 и окно 256K. В таблице смешаны публичные и внутренние наборы, разные агенты, судьи и правила агрегации. Она показывает широкий профиль модели, но не доказывает качество русского языка, скорость на вашем GPU или надёжность собственных инструментов.

Flash-Next и hosted Qwen3.8-Flash

Qwen называет облачную qwen3.8-flash production-версией на базе Flash-Next. Hosted-вариант получает 1M контекста по умолчанию и встроенные web search, code interpreter и другие инструменты платформы. При запуске Flash-Next эти компоненты, безопасность и мониторинг настраивает владелец.

На старте QwenCloud объявил цену hosted Flash $0,16 за миллион входных и $0,47 за миллион выходных токенов; актуальный региональный прайс следует перепроверять перед расчётом. Через OpenRouter также нужно отдельно сверять провайдера, контекст, цену и набор функций. Flash-Next выбирают ради контроля данных, весов и дообучения; hosted Flash — ради быстрого старта и отсутствия многогпу-сервера.

Кому подходит модель

Сильные сценарии — локальный coding-агент, анализ большого репозитория, обработка документов и видео, офисные workflow с инструментами и исследование новых attention-архитектур. Для одного потребительского GPU модель чрезмерна. Она также не лучший выбор, если нужна простая permissive-лицензия для коммерческого coding-ассистента, гарантированное миллионное окно без настройки или готовые встроенные инструменты.

До внедрения проверьте качество на своих русскоязычных данных, пиковую память, latency первого токена, скорость длинного prefill, tool-call JSON и поведение после ошибки инструмента. Агентные benchmark-баллы не заменяют такой прогон.

Частые вопросы

Сколько параметров у Qwen3.8-Flash-Next?

Основная модель содержит 125 млрд параметров и активирует 6 млрд на токен. Отдельно заявлены 51 млрд n-gram embeddings и 4 млрд параметров MTP.

Можно ли запустить её на одной видеокарте?

Официальный BF16-checkpoint требует около 335 GiB памяти весов, FP8 — около 173 GiB. Сторонние кванты существуют, но это другой профиль качества и поддержки; штатный production-запуск рассчитан на несколько ускорителей.

Контекст 1 млн токенов нативный?

Нет. Нативный предел — 262 144 токена. Миллион достигается через статический YaRN и требует отдельной проверки коротких и длинных запросов.

Есть ли обработка изображений и видео?

Да. Модель принимает текст, изображения и видео и возвращает текст. Генерация изображений, видео и аудио не заявлена.

Thinking можно отключить?

Да, параметром enable_thinking=false. Можно также менять уровень reasoning и решать, сохранять ли блоки рассуждений между ходами.

Встроены ли web search и code interpreter?

В открытом checkpoint есть способность вызывать функции, но сами инструменты нужно подключить. Готовые встроенные инструменты относятся к hosted Qwen3.8-Flash.

Разрешено ли коммерческое использование?

В целом да, но Qwen Community License 1.0 требует отдельного разрешения для коммерческого MaaS и самостоятельных AI-ассистентов для кода или офисной работы. Перед запуском такого продукта нужна юридическая проверка.

Источники

Где запустить модель

Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.

Обновляем провайдеров и цены…

Стоимость API

Открытые веса Qwen Community License 1.0; self-hosted — расходы владельца, официальный API относится к отдельной Qwen3.8-Flash

Рассчитать сценарий →

Профиль модели

SWE-ML81%SWE Pro62.5%DeepSWE 1.158.7%

Бенчмарки

DeepSWE 1.158.7%
SWE Bench Pro62.5%
SWE-Bench Multilingual81%
NL2Repo48.1%
CoWorkBench (внутренний)73.9%
Job Bench55.7%
Toolathlon Verified73.5%
GPQA Diamond91.7%
IFBench81.3%
Humanity's Last Exam35.9%
LiveCodeBench91.9%
RecreationBench49.9%
AndroidWorld84.5%
Vision2Web64%
RealWorldQA88.5%
ERQA72.3%
LVBench76.6%

История семейства

Линейка Qwen

Последовательность собрана по датам релиза моделей Qwen в каталоге. Она показывает соседние поколения, но не приписывает им совместимость или наследование архитектуры без отдельного источника.

Экосистема Qwen3.8-Flash-Next

Сервисы, инструменты, материалы и обсуждения, связанные с моделью.

Сервисы с поддержкой модели

Откройте результаты по названию модели и проверьте актуальную интеграцию.

Искать в /services/ →

MCP и инструменты

Весь каталог

Точных связей пока нет. Искать по разработчику.

Обсуждения о Qwen3.8-Flash-Next

Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.

Создать обсуждение