Текущая2026-08-26

От Qwen
Qwen3.8-Flash — облачная production-версия новой экономичной архитектуры Qwen для массовых агентных и coding-задач. Она принимает текст, изображения и видео, возвращает текст, поддерживает контекст 1M, ответ до 128K, thinking до 256K и встроенные инструменты QwenCloud. Открытый Qwen3.8-Flash-Next использует родственную архитектуру, но отличается лицензией, нативным контекстом и набором сервисных функций.
Для Qwen3.8-Flash пока нет совпавших результатов в подключённых публичных лидербордах. Исходные значения карточки не используются для G‑Score.
Показатели G‑Код, G‑Рассуждения, G‑Агенты и G‑Зрение рассчитаны по массовым таблицам LiveBench, Artificial Analysis и LMArena. Наведите или нажмите на значок рядом с оценкой, чтобы увидеть исходный лидерборд, вариант модели, значение и размер выборки.
Уверенность данных
низкая
Покрытие
0 тестов · 0 направлений
Происхождение
нет данных лидербордов
Qwen3.8-Flash — управляемая мультимодальная модель Alibaba для массовых вызовов, coding-агентов и длинного контекста. API принимает текст, изображения и видео, возвращает текст, поддерживает окно 1 млн токенов, thinking, инструменты и JSON. Hosted-модель qwen3.8-flash связана с открытой Qwen3.8-Flash-Next, но веса и тесты опубликованы под именем Flash-Next: это не отдельное измерение облачного endpoint.
Qwen Team называет qwen3.8-flash production-версией Qwen3.8-Flash-Next с контекстом 1M и встроенными инструментами. Страница hosted-модели не раскрывает число параметров и не обещает побайтовую идентичность открытым весам.
| Критерий | Hosted qwen3.8-flash | Open Qwen3.8-Flash-Next |
|---|---|---|
| Доступ | Model Studio/QwenCloud API | веса на Hugging Face и ModelScope, самостоятельный запуск |
| Контекст | 1 000 000 токенов нативно | 262 144 нативно, расширение до 1 000 000 через YaRN |
| Инфраструктура | обслуживает Alibaba | GPU, сервер и обновления на стороне пользователя |
| Инструменты | встроенные возможности платформы плюс function calling | инструменты реализует владелец сервера |
| Дообучение | не поддерживается в Model Studio | доступно для открытых весов |
| Архитектура и параметры | отдельно не раскрыты | MoE: 125 млрд основных параметров, 51 млрд n-gram embeddings, 6 млрд активных на токен |
| Бенчмарки | отдельной таблицы нет | опубликована таблица Qwen3.8-Flash-Next |
У Flash-Next гибрид Gated DeltaNet и Qwen Sparse Attention, четырёхветочный Gated Residual и n-gram embeddings. Считать их подтверждённой спецификацией hosted endpoint пока нельзя.
Модель принимает текст, изображения и видео, а генерирует только текст. Она подходит для разбора скриншотов, графиков, документов и видеозаписей, но не создаёт изображения, видео или аудио. Для visual input заявлены до 16 млн пикселей на изображение, до 2048 изображений, до 64 видео и до 2 часов либо 2 ГБ на видео.
Точные токенные пределы отличаются от короткой маркировки «1M/128K»:
Миллионное окно помогает анализировать репозиторий или корпус документов одним запросом, но не гарантирует одинаковую точность по всей длине. Проверяйте извлечение из начала, середины и конца, задержку и стоимость.
Qwen3.8-Flash работает как гибридная reasoning-модель: thinking можно включать и отключать. У reasoning_effort есть уровни low, medium и xhigh, которые при автоматическом преобразовании соответствуют бюджетам 4096, 16 384 и 262 144 reasoning-токена. reasoning_effort и thinking_budget нельзя задавать одновременно. Если не передать ни один параметр, документация указывает xhigh и стандартный бюджет 131 072.
preserve_thinking включён по умолчанию. Клиент должен возвращать прежний reasoning_content отдельным полем; эта история считается входными токенами, а новое reasoning — выходными. Для массовых операций стоит отключать thinking, а для длинного агента — ограничивать бюджет и шаги.
Модель поддерживает function calling, параллельные вызовы, structured outputs, context cache и partial mode. Доступны OpenAI-совместимые Chat Completions и Responses API, Anthropic-совместимый /v1/messages и DashScope. Её можно подключить к Qwen Code, а промпты проверить в Qwen Studio.
Доступность встроенного web search нужно тестировать в выбранном регионе: карточка модели отмечает поддержку в Beijing и Singapore, но не в Global, тогда как отдельное руководство web search перечисляет Qwen3.8-Flash и для Global. Function calling и собственные инструменты приложения от этого расхождения не зависят.
Базовые цены Model Studio на 7 сентября 2026 года не зависят от длины входа внутри окна:
| Регион и scope | Вход | Выход | Implicit cache hit | Explicit cache: создание / чтение |
|---|---|---|---|---|
| China (Beijing); Global в Hong Kong, Frankfurt, Tokyo и Virginia | $0,113 | $0,382 | $0,014 | $0,177 / $0,014 |
| Singapore, International | $0,15 | $0,47 | $0,016 | $0,20 / $0,016 |
Все суммы указаны за 1 млн токенов и без временных акций. Implicit cache ищет общий префикс автоматически; технический минимум — 1024 токена, но попадание не гарантируется. Explicit cache требует отдельного создания. Карточка модели помечает Batch как unsupported, хотя таблица цен Beijing показывает скидку 50%: до проверки API считать его доступным нельзя.
Endpoint и API key привязаны к региону. Модель доступна в Beijing и Singapore, а с Global scope — в Hong Kong, Frankfurt, Tokyo и Virginia. При доступе через OpenRouter отдельно проверяйте провайдера, цену, контекст, кэш и инструменты маршрута.
Ниже — официальные результаты Qwen3.8-Flash-Next, то есть открытой модели и технологической линии hosted Flash. Это не отдельные hosted-specific замеры qwen3.8-flash.
| Тест | Результат | Существенная методологическая оговорка |
|---|---|---|
| DeepSWE 1.1 | 58,7 | лучший из Claude Code и mini-SWE-agent; 256K |
| SWE-bench Pro | 62,5 | Claude Code; исправленный набор; 256K |
| SWE-bench Multilingual | 81,0 | mini-SWE-agent; 256K |
| CoWorkBench | 73,9 | внутренний long-horizon office benchmark Qwen |
| Toolathlon Verified | 73,5 pass@1 | реальное использование инструментов |
| IFBench | 81,3 | следование инструкциям |
| GPQA Diamond | 91,7 | научное рассуждение |
| LiveCodeBench v6 | 91,9 | соревновательное программирование |
| OSWorld 2.0 | 19,4 binary / 52,3 partial | полное и частичное выполнение computer-use задач |
| LVBench | 76,6 | понимание длинного видео |
Первые три coding-теста используют агентные harness, температуру 1,0, top_p=0,95 и контекст 256K. В остальных различаются инструменты, судьи и агрегация. Качество русского языка, latency и цена успешной задачи требуют собственного теста.
Hosted Flash подходит для массового анализа документов, coding-ассистентов, извлечения JSON, больших репозиториев и мультимодальных агентов. Карточка указывает до 30 000 RPM и 5 млн TPM для Beijing/Global, до 15 000 RPM и 2 млн TPM для Singapore.
Открытый Flash-Next выбирают для локального размещения, контроля весов, дообучения или собственной оптимизации. Цена — 176 млрд хранимых параметров с n-gram embeddings и сложный мультимодальный serving. Hosted Flash лучше для быстрого запуска, 1M без настройки YaRN и сервисов Alibaba.
Ограничения облачной версии: только текстовый выход, отсутствие fine-tuning и Batch, региональная привязка ключей, тарификация сохранённого reasoning и неустранённое расхождение документации по web search. Function calling не делает действия надёжными автоматически: права, таймауты, повторы и необратимые операции должен контролировать внешний оркестратор.
Это связанные, но разные формы поставки. Qwen называет hosted Flash production-версией Flash-Next, однако веса, параметры и бенчмарки опубликованы под именем открытой Flash-Next.
Нет. Контекст hosted-модели равен 1M токенов, а 128K — максимальный текстовый вывод: 131 072 токена.
Да. Для быстрых запросов используйте enable_thinking=false или совместимый уровень reasoning_effort=none. Для сложных задач доступны low, medium и xhigh.
Нет. Поддерживаемый вход — текст, изображения и видео; выход — только текст.
Нет. Карточка Model Studio помечает fine-tuning как неподдерживаемый. Для собственного обучения нужны открытые веса Flash-Next.
Нет. Implicit cache включён автоматически, но Alibaba прямо не гарантирует попадание даже при идентичном контексте. Проверяйте фактические cached tokens в usage.
Нет. Это официальный ориентир общей технологической линии, а не опубликованный отдельный прогон qwen3.8-flash в Model Studio.
Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.
Для диаграммы пока недостаточно сопоставимых тестов.
Сопоставимые числовые результаты пока не опубликованы. В каталоге они отмечены знаком «?», без оценочных значений.
История семейства
Последовательность собрана по датам релиза моделей Qwen в каталоге. Она показывает соседние поколения, но не приписывает им совместимость или наследование архитектуры без отдельного источника.
Сервисы, инструменты, материалы и обсуждения, связанные с моделью.
Точных связей пока нет. Искать по разработчику.
Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.