К списку моделей
Логотип Qwen, разработчика Qwen3.8-Flash

Qwen3.8-Flash

G-Score: н/д

От Qwen

Proprietary
FAMQwen
CTX1M
PAR125B основная модель / около 6B активных (MoE)
Релиз: 2026-08-26
FlashMoEMultimodalCodeReasoningAgentic

Краткое описание

Qwen3.8-Flash — облачная production-версия новой экономичной архитектуры Qwen для массовых агентных и coding-задач. Она принимает текст, изображения и видео, возвращает текст, поддерживает контекст 1M, ответ до 128K, thinking до 256K и встроенные инструменты QwenCloud. Открытый Qwen3.8-Flash-Next использует родственную архитектуру, но отличается лицензией, нативным контекстом и набором сервисных функций.

G-Score и профиль

G-Score: н/д

Для Qwen3.8-Flash пока нет совпавших результатов в подключённых публичных лидербордах. Исходные значения карточки не используются для G‑Score.

Показатели G‑Код, G‑Рассуждения, G‑Агенты и G‑Зрение рассчитаны по массовым таблицам LiveBench, Artificial Analysis и LMArena. Наведите или нажмите на значок рядом с оценкой, чтобы увидеть исходный лидерборд, вариант модели, значение и размер выборки.

Уверенность данных

низкая

Покрытие

0 тестов · 0 направлений

Происхождение

нет данных лидербордов

Как рассчитан профиль →

Подробный обзор модели

Qwen3.8-Flash — управляемая мультимодальная модель Alibaba для массовых вызовов, coding-агентов и длинного контекста. API принимает текст, изображения и видео, возвращает текст, поддерживает окно 1 млн токенов, thinking, инструменты и JSON. Hosted-модель qwen3.8-flash связана с открытой Qwen3.8-Flash-Next, но веса и тесты опубликованы под именем Flash-Next: это не отдельное измерение облачного endpoint.

Hosted Qwen3.8-Flash и открытая Flash-Next

Qwen Team называет qwen3.8-flash production-версией Qwen3.8-Flash-Next с контекстом 1M и встроенными инструментами. Страница hosted-модели не раскрывает число параметров и не обещает побайтовую идентичность открытым весам.

КритерийHosted qwen3.8-flashOpen Qwen3.8-Flash-Next
ДоступModel Studio/QwenCloud APIвеса на Hugging Face и ModelScope, самостоятельный запуск
Контекст1 000 000 токенов нативно262 144 нативно, расширение до 1 000 000 через YaRN
Инфраструктураобслуживает AlibabaGPU, сервер и обновления на стороне пользователя
Инструментывстроенные возможности платформы плюс function callingинструменты реализует владелец сервера
Дообучениене поддерживается в Model Studioдоступно для открытых весов
Архитектура и параметрыотдельно не раскрытыMoE: 125 млрд основных параметров, 51 млрд n-gram embeddings, 6 млрд активных на токен
Бенчмаркиотдельной таблицы нетопубликована таблица Qwen3.8-Flash-Next

У Flash-Next гибрид Gated DeltaNet и Qwen Sparse Attention, четырёхветочный Gated Residual и n-gram embeddings. Считать их подтверждённой спецификацией hosted endpoint пока нельзя.

Модальности и лимиты 1M/128K

Модель принимает текст, изображения и видео, а генерирует только текст. Она подходит для разбора скриншотов, графиков, документов и видеозаписей, но не создаёт изображения, видео или аудио. Для visual input заявлены до 16 млн пикселей на изображение, до 2048 изображений, до 64 видео и до 2 часов либо 2 ГБ на видео.

Точные токенные пределы отличаются от короткой маркировки «1M/128K»:

  • окно контекста — 1 000 000 токенов;
  • максимальный вход без thinking — 991 808 токенов;
  • максимальный вход с thinking — 983 616 токенов;
  • максимальный вывод — 131 072 токена, то есть 128K;
  • максимальная цепочка рассуждений — 262 144 токена.

Миллионное окно помогает анализировать репозиторий или корпус документов одним запросом, но не гарантирует одинаковую точность по всей длине. Проверяйте извлечение из начала, середины и конца, задержку и стоимость.

Thinking, инструменты и API

Qwen3.8-Flash работает как гибридная reasoning-модель: thinking можно включать и отключать. У reasoning_effort есть уровни low, medium и xhigh, которые при автоматическом преобразовании соответствуют бюджетам 4096, 16 384 и 262 144 reasoning-токена. reasoning_effort и thinking_budget нельзя задавать одновременно. Если не передать ни один параметр, документация указывает xhigh и стандартный бюджет 131 072.

preserve_thinking включён по умолчанию. Клиент должен возвращать прежний reasoning_content отдельным полем; эта история считается входными токенами, а новое reasoning — выходными. Для массовых операций стоит отключать thinking, а для длинного агента — ограничивать бюджет и шаги.

Модель поддерживает function calling, параллельные вызовы, structured outputs, context cache и partial mode. Доступны OpenAI-совместимые Chat Completions и Responses API, Anthropic-совместимый /v1/messages и DashScope. Её можно подключить к Qwen Code, а промпты проверить в Qwen Studio.

Доступность встроенного web search нужно тестировать в выбранном регионе: карточка модели отмечает поддержку в Beijing и Singapore, но не в Global, тогда как отдельное руководство web search перечисляет Qwen3.8-Flash и для Global. Function calling и собственные инструменты приложения от этого расхождения не зависят.

Цена, кэш и регионы

Базовые цены Model Studio на 7 сентября 2026 года не зависят от длины входа внутри окна:

Регион и scopeВходВыходImplicit cache hitExplicit cache: создание / чтение
China (Beijing); Global в Hong Kong, Frankfurt, Tokyo и Virginia$0,113$0,382$0,014$0,177 / $0,014
Singapore, International$0,15$0,47$0,016$0,20 / $0,016

Все суммы указаны за 1 млн токенов и без временных акций. Implicit cache ищет общий префикс автоматически; технический минимум — 1024 токена, но попадание не гарантируется. Explicit cache требует отдельного создания. Карточка модели помечает Batch как unsupported, хотя таблица цен Beijing показывает скидку 50%: до проверки API считать его доступным нельзя.

Endpoint и API key привязаны к региону. Модель доступна в Beijing и Singapore, а с Global scope — в Hong Kong, Frankfurt, Tokyo и Virginia. При доступе через OpenRouter отдельно проверяйте провайдера, цену, контекст, кэш и инструменты маршрута.

Что показывают бенчмарки

Ниже — официальные результаты Qwen3.8-Flash-Next, то есть открытой модели и технологической линии hosted Flash. Это не отдельные hosted-specific замеры qwen3.8-flash.

ТестРезультатСущественная методологическая оговорка
DeepSWE 1.158,7лучший из Claude Code и mini-SWE-agent; 256K
SWE-bench Pro62,5Claude Code; исправленный набор; 256K
SWE-bench Multilingual81,0mini-SWE-agent; 256K
CoWorkBench73,9внутренний long-horizon office benchmark Qwen
Toolathlon Verified73,5 pass@1реальное использование инструментов
IFBench81,3следование инструкциям
GPQA Diamond91,7научное рассуждение
LiveCodeBench v691,9соревновательное программирование
OSWorld 2.019,4 binary / 52,3 partialполное и частичное выполнение computer-use задач
LVBench76,6понимание длинного видео

Первые три coding-теста используют агентные harness, температуру 1,0, top_p=0,95 и контекст 256K. В остальных различаются инструменты, судьи и агрегация. Качество русского языка, latency и цена успешной задачи требуют собственного теста.

Сценарии, ограничения и выбор

Hosted Flash подходит для массового анализа документов, coding-ассистентов, извлечения JSON, больших репозиториев и мультимодальных агентов. Карточка указывает до 30 000 RPM и 5 млн TPM для Beijing/Global, до 15 000 RPM и 2 млн TPM для Singapore.

Открытый Flash-Next выбирают для локального размещения, контроля весов, дообучения или собственной оптимизации. Цена — 176 млрд хранимых параметров с n-gram embeddings и сложный мультимодальный serving. Hosted Flash лучше для быстрого запуска, 1M без настройки YaRN и сервисов Alibaba.

Ограничения облачной версии: только текстовый выход, отсутствие fine-tuning и Batch, региональная привязка ключей, тарификация сохранённого reasoning и неустранённое расхождение документации по web search. Function calling не делает действия надёжными автоматически: права, таймауты, повторы и необратимые операции должен контролировать внешний оркестратор.

Частые вопросы

Qwen3.8-Flash и Qwen3.8-Flash-Next — одна модель?

Это связанные, но разные формы поставки. Qwen называет hosted Flash production-версией Flash-Next, однако веса, параметры и бенчмарки опубликованы под именем открытой Flash-Next.

128K — это размер контекста?

Нет. Контекст hosted-модели равен 1M токенов, а 128K — максимальный текстовый вывод: 131 072 токена.

Можно ли отключить thinking?

Да. Для быстрых запросов используйте enable_thinking=false или совместимый уровень reasoning_effort=none. Для сложных задач доступны low, medium и xhigh.

Есть ли у модели аудиовход или генерация изображений?

Нет. Поддерживаемый вход — текст, изображения и видео; выход — только текст.

Поддерживается ли тонкая настройка hosted-модели?

Нет. Карточка Model Studio помечает fine-tuning как неподдерживаемый. Для собственного обучения нужны открытые веса Flash-Next.

Гарантирует ли повторный длинный префикс скидку кэша?

Нет. Implicit cache включён автоматически, но Alibaba прямо не гарантирует попадание даже при идентичном контексте. Проверяйте фактические cached tokens в usage.

Можно ли считать баллы Flash-Next результатами hosted endpoint?

Нет. Это официальный ориентир общей технологической линии, а не опубликованный отдельный прогон qwen3.8-flash в Model Studio.

Источники

Где запустить модель

Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.

Обновляем провайдеров и цены…

Стоимость API

$0.15 / $0.47 за 1M токенов; cached input около $0.016

Рассчитать сценарий →

Профиль модели

Для диаграммы пока недостаточно сопоставимых тестов.

Бенчмарки

Сопоставимые числовые результаты пока не опубликованы. В каталоге они отмечены знаком «?», без оценочных значений.

История семейства

Линейка Qwen

Последовательность собрана по датам релиза моделей Qwen в каталоге. Она показывает соседние поколения, но не приписывает им совместимость или наследование архитектуры без отдельного источника.

Экосистема Qwen3.8-Flash

Сервисы, инструменты, материалы и обсуждения, связанные с моделью.

MCP и инструменты

Весь каталог

Точных связей пока нет. Искать по разработчику.

Статьи и термины

Все статьи

Обсуждения о Qwen3.8-Flash

Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.

Создать обсуждение