Текущая2026-08-26

От Qwen
Qwen3.8-Flash-Next — открытый мультимодальный MoE-preview архитектуры, которую Qwen исследует для будущего Qwen4. Основная модель имеет 125 млрд параметров, ещё 51 млрд находятся в n-gram embeddings, а на токен активируется около 6 млрд. Нативный контекст — 262 144 токена с расширением до 1M; веса опубликованы по Qwen Community License 1.0.
Для Qwen3.8-Flash-Next пока нет совпавших результатов в подключённых публичных лидербордах. Исходные значения карточки не используются для G‑Score.
Показатели G‑Код, G‑Рассуждения, G‑Агенты и G‑Зрение рассчитаны по массовым таблицам LiveBench, Artificial Analysis и LMArena. Наведите или нажмите на значок рядом с оценкой, чтобы увидеть исходный лидерборд, вариант модели, значение и размер выборки.
Уверенность данных
низкая
Покрытие
0 тестов · 0 направлений
Происхождение
нет данных лидербордов
Место исходного бенчмарка показывается только при закреплённом source record и среди других карточек с источником. Эти старые значения не участвуют в G-Score лидербордов.
| Бенчмарк | Результат | Место | Доказательство |
|---|---|---|---|
| DeepSWE 1.1 | 58.7% | 6 из 7 | Результат разработчика |
| SWE Bench Pro | 62.5% | 3 из 8 | Результат разработчика |
| SWE-Bench Multilingual | 81% | 2 из 5 | Результат разработчика |
| NL2Repo | 48.1% | 6 из 8 | Результат разработчика |
| CoWorkBench (внутренний) | 73.9% | 2 из 4 | Внутренний тест разработчика |
| Job Bench | 55.7% | 1 из 2 | Результат разработчика |
| Toolathlon Verified | 73.5% | 5 из 8 | Результат разработчика |
| GPQA Diamond | 91.7% | 3 из 3 | Результат разработчика |
| IFBench | 81.3% | 2 из 4 | Результат разработчика |
| Humanity's Last Exam | 35.9% | 6 из 7 | Результат разработчика |
| LiveCodeBench | 91.9% | 1 из 4 | Результат разработчика |
| RecreationBench | 49.9% | 1 из 1 | Внутренний тест разработчика |
| AndroidWorld | 84.5% | 1 из 2 | Результат разработчика |
| Vision2Web | 64% | 1 из 1 | Внутренний тест разработчика |
| RealWorldQA | 88.5% | 1 из 2 | Результат разработчика |
| ERQA | 72.3% | 1 из 2 | Результат разработчика |
| LVBench | 76.6% | 1 из 2 | Результат разработчика |
Происхождение результатов
Результаты опубликованы Qwen и не воспроизводились независимо. Coding и agentic строки используют разные harness, turn budgets, judges и ограничения; прогон на 256K не доказывает качество YaRN при 1M.
Вариант: Qwen/Qwen3.8-Flash-Next post-trained open-weight checkpoint · получено 2026-09-07
Qwen3.8-Flash-Next — мультимодальная MoE-модель Alibaba с открытыми весами и архитектурой будущего Qwen4. Она принимает текст, изображения и видео, нативно держит 262 144 токена и расширяется до 1 млн. Главный компромисс: активны лишь 6 млрд параметров, но BF16-checkpoint занимает около 335 GiB, поэтому нужен многопроцессорный сервер.
Flash-Next — post-trained checkpoint Qwen/Qwen3.8-Flash-Next на Hugging Face, а не только исследовательская base-модель. Его основная языковая часть содержит 125 млрд параметров, из которых на токен активируются 6 млрд. Отдельно указаны 51 млрд параметров n-gram embeddings и 4 млрд параметров MTP — модуля предсказания нескольких следующих токенов. Размер репозитория с BF16-весами составляет около 360 GB, или 335,28 GiB по рецепту vLLM.
Модель имеет 48 слоёв и 512 экспертов: маршрутизатор выбирает 10, плюс работает один общий эксперт. Это объясняет низкий объём вычислений на токен, но не превращает checkpoint в «модель на 6B»: хранить и распределять между устройствами приходится гораздо больше весов.
Qwen Community License 1.0 разрешает использовать, изменять, дообучать и распространять производные версии. Продукты крупнее 100 млн активных пользователей в месяц или $20 млн месячной выручки должны заметно показывать имя модели. Для коммерческого Model-as-a-Service и самостоятельного AI-ассистента для кода или офисной работы требуется отдельная лицензия Qwen. Поэтому «open-weight» здесь точнее, чем безоговорочное «open source».
В 48 слоях повторяется схема: три слоя Gated DeltaNet, затем один слой Qwen Sparse Attention. Gated DeltaNet сжимает прошлый контекст в компактное состояние и дешёво ведёт последовательность. QSA возвращает выборочный доступ к полной истории: лёгкий индексатор оценивает не отдельные токены, а микроблоки и передаёт вниманию наиболее важные участки. Такая пара рассчитана на длинные агентные сессии, где нужно одновременно помнить общий ход работы и точно извлекать старые детали.
Gated Residual расширяет residual stream до четырёх ветвей. Динамический gate управляет чтением, а скалярный gate — записью по ветвям. N-gram Embedding на втором слое адресует таблицы по биграммам и триграммам; эти 51 млрд параметров добавляют ёмкость без сопоставимого роста матричных вычислений и могут храниться в оперативной памяти с асинхронной подгрузкой. Технический отчёт предупреждает: уменьшение loss при увеличении n-gram-словаря не всегда даёт такой же рост downstream-качества.
MTP означает Multi-Token Prediction. Однослойный модуль обучен предсказывать несколько шагов и может служить draft-моделью для speculative decoding. Но ускорение не гарантировано: в опубликованном рецепте vLLM на четырёх H100 принятие speculative-токенов было около 36%, а throughput с MTP оказался на 8–36% ниже. Опцию нужно проверять на своём железе и профиле запросов.
Нативное окно равно 262 144 токенам. До 1 000 000 его расширяют статическим YaRN с коэффициентом 4; для типичных 524 288 токенов Qwen рекомендует коэффициент 2. Статическое масштабирование действует и на короткие запросы, поэтому может ухудшить их качество. Миллионный режим стоит включать только для отдельного длинноконтекстного профиля и проверять извлечение из начала, середины и конца.
Flash-Next принимает текст, изображения и видео, но генерирует текст. Это подходит для анализа скриншотов, диаграмм, интерфейсов и длинных роликов. Аудиовход и генерация медиа не заявлены. Для часового видео растут visual-токены, KV-cache, задержка и требования к памяти — сама поддержка формата ещё не означает дешёвый запуск.
Thinking включён по умолчанию. Его можно отключить через enable_thinking=false, сохранить рассуждения между ходами через preserve_thinking и выбрать reasoning_effort: low, medium или xhigh. Для локального API нужны совместимые reasoning- и tool-call-парсеры. Модель умеет формировать вызовы функций, но поиск, интерпретатор и другие инструменты предоставляет ваш оркестратор. Для работы с репозиториями её можно подключить к Qwen Code.
Официально перечислены Transformers, SGLang, vLLM и TokenSpeed; llama.cpp поддерживает GGUF для текста и зрения, MLX-VLM — Apple Silicon. Простой transformers serve полезен для проверки совместимости, а production-serving лучше строить на специализированном движке.
Практические ориентиры vLLM показывают масштаб задачи:
MoE экономит вычисления, однако длинный контекст всё равно раздувает KV-cache. Начинайте с меньшего max-model-len, измеряйте пиковую память на реальных изображениях и видео, затем увеличивайте параллелизм. У открытых весов нет тарифа за токен, но сервер, хранение, трафик и сопровождение оплачивает владелец.
| Тест | Qwen3.8-Flash-Next | Что важно учесть |
|---|---|---|
| DeepSWE 1.1 | 58,7 | лучший результат из двух harness: Claude Code и mini-SWE-agent; 256K |
| SWE-bench Pro | 62,5 | Claude Code; исправленный набор; все baseline перезапущены |
| SWE-bench Multilingual | 81,0 | mini-SWE-agent; 256K |
| NL2Repo-Bench | 48,1 | Claude Code; запрещены команды скачивания целевого репозитория |
| CoWorkBench | 73,9 | внутренний тест Qwen на долгие офисные задачи |
| Toolathlon Verified | 73,5 pass@1 | использование инструментов в реальных сценариях |
| GPQA Diamond | 91,7 | научные вопросы |
| LiveCodeBench v6 | 91,9 | соревновательное программирование |
| OSWorld 2.0 | 19,4 binary / 52,3 partial | полное выполнение и частичная награда — разные метрики |
| LVBench | 76,6 | понимание длинного видео |
В coding-тестах Qwen использовала temperature=1.0, top_p=0.95 и окно 256K. В таблице смешаны публичные и внутренние наборы, разные агенты, судьи и правила агрегации. Она показывает широкий профиль модели, но не доказывает качество русского языка, скорость на вашем GPU или надёжность собственных инструментов.
Qwen называет облачную qwen3.8-flash production-версией на базе Flash-Next. Hosted-вариант получает 1M контекста по умолчанию и встроенные web search, code interpreter и другие инструменты платформы. При запуске Flash-Next эти компоненты, безопасность и мониторинг настраивает владелец.
На старте QwenCloud объявил цену hosted Flash $0,16 за миллион входных и $0,47 за миллион выходных токенов; актуальный региональный прайс следует перепроверять перед расчётом. Через OpenRouter также нужно отдельно сверять провайдера, контекст, цену и набор функций. Flash-Next выбирают ради контроля данных, весов и дообучения; hosted Flash — ради быстрого старта и отсутствия многогпу-сервера.
Сильные сценарии — локальный coding-агент, анализ большого репозитория, обработка документов и видео, офисные workflow с инструментами и исследование новых attention-архитектур. Для одного потребительского GPU модель чрезмерна. Она также не лучший выбор, если нужна простая permissive-лицензия для коммерческого coding-ассистента, гарантированное миллионное окно без настройки или готовые встроенные инструменты.
До внедрения проверьте качество на своих русскоязычных данных, пиковую память, latency первого токена, скорость длинного prefill, tool-call JSON и поведение после ошибки инструмента. Агентные benchmark-баллы не заменяют такой прогон.
Основная модель содержит 125 млрд параметров и активирует 6 млрд на токен. Отдельно заявлены 51 млрд n-gram embeddings и 4 млрд параметров MTP.
Официальный BF16-checkpoint требует около 335 GiB памяти весов, FP8 — около 173 GiB. Сторонние кванты существуют, но это другой профиль качества и поддержки; штатный production-запуск рассчитан на несколько ускорителей.
Нет. Нативный предел — 262 144 токена. Миллион достигается через статический YaRN и требует отдельной проверки коротких и длинных запросов.
Да. Модель принимает текст, изображения и видео и возвращает текст. Генерация изображений, видео и аудио не заявлена.
Да, параметром enable_thinking=false. Можно также менять уровень reasoning и решать, сохранять ли блоки рассуждений между ходами.
В открытом checkpoint есть способность вызывать функции, но сами инструменты нужно подключить. Готовые встроенные инструменты относятся к hosted Qwen3.8-Flash.
В целом да, но Qwen Community License 1.0 требует отдельного разрешения для коммерческого MaaS и самостоятельных AI-ассистентов для кода или офисной работы. Перед запуском такого продукта нужна юридическая проверка.
Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.
Открытые веса Qwen Community License 1.0; self-hosted — расходы владельца, официальный API относится к отдельной Qwen3.8-Flash
Рассчитать сценарий →История семейства
Последовательность собрана по датам релиза моделей Qwen в каталоге. Она показывает соседние поколения, но не приписывает им совместимость или наследование архитектуры без отдельного источника.

2026-05-20

2026-06-01

2026-08-03

2026-08-14

2026-08-26
Текущая2026-08-26

2026-09-02
Сервисы, инструменты, материалы и обсуждения, связанные с моделью.
Откройте результаты по названию модели и проверьте актуальную интеграцию.
Точных связей пока нет. Искать по разработчику.
Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.