К списку моделей
Логотип Z.ai, разработчика GLM-5.3-Flash

GLM-5.3-Flash

G-Score: н/д

От Z.ai

Open Source
FAMGLM
CTX1M
PAR320B всего / 18B активных (MoE)
Релиз: 2026-08-26
FlashMoEOpen-SourceMultimodalCodeReasoningAgenticVision

Краткое описание

GLM-5.3-Flash — первая нативно мультимодальная модель семейства GLM-5 и раскрытая версия бывшего stealth-preview Ox Alpha. MoE-архитектура содержит 320 млрд параметров и активирует 18 млрд на токен, сочетая linear и sparse attention. Модель принимает текст, изображения, видео и файлы, имеет контекст до 1M, открытые веса MIT и поддерживает локальный запуск.

G-Score и профиль

G-Score: н/д

Для GLM-5.3-Flash пока нет совпавших результатов в подключённых публичных лидербордах. Исходные значения карточки не используются для G‑Score.

Показатели G‑Код, G‑Рассуждения, G‑Агенты и G‑Зрение рассчитаны по массовым таблицам LiveBench, Artificial Analysis и LMArena. Наведите или нажмите на значок рядом с оценкой, чтобы увидеть исходный лидерборд, вариант модели, значение и размер выборки.

Уверенность данных

низкая

Покрытие

0 тестов · 0 направлений

Происхождение

нет данных лидербордов

Как рассчитан профиль →

Место модели в каталоге

Место исходного бенчмарка показывается только при закреплённом source record и среди других карточек с источником. Эти старые значения не участвуют в G-Score лидербордов.

БенчмаркРезультатМестоДоказательство
MMVU80.5%1 из 1Результат разработчика
MVBench77.8%1 из 1Результат разработчика
NL2Repo56.3%4 из 8Результат разработчика
BabyVision53.4%1 из 1Результат разработчика
DeepSWE 1.163.4%5 из 7Результат разработчика
OfficeQA Pro62.4%3 из 3Результат разработчика
Humanity's Last Exam с инструментами55.3%6 из 7Результат разработчика
Automation Bench48.8%1 из 5Внутренний тест разработчика
Agents' Last Exam26.3%3 из 3Результат разработчика
GDPval-AA v2 (Elo)17732 из 8Результат разработчика
Terminal-Bench 2.184.3%6 из 9Результат разработчика
Toolathlon Verified78.4%1 из 8Результат разработчика
Chartography с инструментами78%1 из 1Внутренний тест разработчика
CharXiv Reasoning с инструментами89.4%1 из 1Внутренний тест разработчика

Происхождение результатов

Все значения опубликованы Z.ai и не воспроизводились независимо. Таблица смешивает coding, agents и vision с разными harness, judges и лимитами; для Agents' Last Exam и части visual rows полная методика не раскрыта.

Вариант: GLM-5.3-Flash, reasoning_effort=max; benchmark-specific harness · получено 2026-09-07

Подробный обзор модели

GLM-5.3-Flash — открытая мультимодальная MoE-модель Z.ai для программирования, агентных процессов и работы с визуальными материалами. Она принимает текст, изображения и видео, поддерживает контекст до 1 048 576 токенов и активирует 18 из 320 млрд параметров. Модель выглядит особенно интересно для команд, которым нужен недорогой API или контролируемый self-hosting, но её полный checkpoint всё равно требует серверного оборудования.

Что скрывалось под именем Ox Alpha

До релиза Z.ai анонимно обслуживала модель под именем Ox Alpha, также ox-alpha, через OpenCode и OpenRouter. Компания называет её самой популярной моделью той недели, но методику ранжирования и состав запросов не публикует.

GLM-5.3-Flash обучена как новая базовая модель на мультимодальном корпусе объёмом 30 трлн токенов. Z.ai позиционирует Flash как экономичный вариант и сообщает о превосходстве над GLM-5.2 в своих тестах; рабочее решение требует проверки на собственных данных.

Архитектура и параметры

Это Mixture of Experts — модель с маршрутизацией по экспертам. Всего у неё около 320 млрд параметров, но для каждого токена активируются примерно 18 млрд. Конфигурация содержит 45 языковых слоёв: 34 слоя линейного внимания KDA и 11 слоёв разреженного MLA-внимания. После трёх плотных feed-forward-слоёв используются 288 маршрутизируемых экспертов; на токен выбираются восемь, дополнительно работает один общий эксперт.

Линейное внимание хранит локальную историю в состоянии, а разреженное извлекает важные фрагменты всей последовательности. IndexPool объединяет четыре ключевых вектора в один. Manifold-Constrained Hyper-Connections, или mHC, управляет четырьмя residual-потоками; один MTP-слой используется для speculative decoding.

По расчётам Z.ai, Flash требует в 3,01 раза меньше вычислений внимания и в 4,44 раза меньше KV-cache, чем GLM-5.3. Это оценки поставщика: фактическая скорость зависит от запроса, движка и параллелизма.

Контекст, модальности и вывод

Контекст checkpoint равен 1 048 576 токенам, а максимальный ответ в облачном API — 128 тысяч. Входные модальности — текст, изображения и видео; результат — текст. Облачная платформа также принимает файлы, но PDF, DOCX, PPTX или XLSX обычно требуют извлечения содержимого, рендеринга и инструментов агента. Сама языковая модель не создаёт готовый редактируемый файл без такого окружения.

Миллион токенов помогает при анализе репозитория или архива, но длинный prefill увеличивает задержку и память. Точность извлечения нужно тестировать в начале, середине и конце контекста.

Thinking и работа с инструментами

Режим рассуждений включён постоянно и не отключается. Параметр reasoning_effort принимает low, high и max; по умолчанию применяется max, он же нужен для воспроизведения опубликованных бенчмарков. Для коротких классификаций или простого JSON разумнее начинать с low, а для многошагового агента сравнить high и max по стоимости успешной задачи.

Модель поддерживает function calling, потоковые вызовы, JSON и кэширование. Функции исполняет приложение: модель формирует аргументы, а оркестратор запускает инструмент. В Coding Plan она доступна через ZCode — конкретный coding-инструмент, не общее название чата Z.ai.

API: акционная и обычная цена

На 7 сентября 2026 года Z.ai даёт скидку 50% до 24:00 9 сентября по времени UTC+8. Все суммы указаны за миллион токенов.

ОперацияЦена по акцииОбычная цена
Вход$0,075$0,15
Кэшированный вход$0,015$0,03
Выход$0,25$0,50

Хранение кэша временно бесплатно, web search стоит $0,01 за вызов. В Coding Plan до 20 сентября, с 23:00 до 09:00 UTC+8, Flash через ZCode не расходует квоту, а другие поддерживаемые агенты получают двойную. Через OpenRouter тариф, провайдера, контекст и vision нужно сверять перед запуском.

Открытые веса и локальный запуск

Checkpoint опубликован на Hugging Face по MIT: разрешены изменение и коммерческое распространение с сохранением copyright-уведомления. Основной zai-org/GLM-5.3-Flash занимает около 306 GiB в FP8 без движка и KV-cache; BF16 требует примерно вдвое больше. «18B active» не означает запуск на обычной видеокарте.

Поддерживаются SGLang, vLLM, TokenSpeed, Transformers, KTransformers и Unsloth. Рецепт vLLM 0.29.0+ показывает FP8 с tensor parallel 4 на GB200; для sparse MLA нужен FlashInfer 0.6.17+. Также заявлены Hopper+, AMD gfx950 и Ascend 950PR в проверенной конфигурации TP8. Начинать стоит с меньшего контекста и измерять память и задержку.

Бенчмарки и оговорки

ТестРезультат GLM-5.3-FlashУсловия
Terminal-Bench 2.184,3Claude Code 2.1.207, 6 часов, до 65 536 новых токенов
DeepSWE v1.163,4mini-swe-agent, 400K контекста, таймаут 6 часов
NL2Repo56,31M контекста, до 64K новых токенов, защита от запрещённых команд
Toolathlon Verified78,4pass@1, среднее трёх независимых прогонов официального сервиса
AutomationBench v1.0.648,8версия с исправлением обработки null
Agents’ Last Exam26,3подробные условия Z.ai не раскрыла
HLE with Tools, full set55,3300K, до 163 840 токенов; судья GPT-5.6-luna medium
GDPval-AA v21773оценка Artificial Analysis; шкала не процентная
OfficeQA Pro62,4профессиональные офисные задачи
CharXiv Reasoning with Tools89,4графики и научные документы с инструментами
BabyVision53,4164K; короткая сторона изображения не менее 1,5K пикселей
MMVU80,5мультимодальное понимание

Все числа опубликованы Z.ai и не воспроизводились в рамках этого обзора. Наборы используют разные harness, судей, лимиты и шкалы, поэтому усреднять их нельзя. Они не измеряют отдельно русский язык, локальную FP8-скорость, галлюцинации в документах или надёжность ваших функций.

Для каких задач выбирать GLM-5.3-Flash

Модель подходит для агентной разработки, больших репозиториев, визуальной проверки интерфейсов, документов и видео. API выгоден при большом входе, self-hosting — для контроля данных и весов.

Для простого чат-бота checkpoint чрезмерен. В production нужны тесты JSON, повторных tool calls, таймаутов и восстановления после ошибок. Изображения, аудио и офисные файлы создаёт отдельный инструментальный слой.

Частые вопросы

GLM-5.3-Flash и Ox Alpha — одна модель?

Да. Z.ai сообщает, что до релиза тестировала GLM-5.3-Flash анонимно как Ox Alpha на OpenCode и OpenRouter.

Сколько параметров реально используется?

Всего около 320 млрд, а на токен активируется примерно 18 млрд. Для хранения checkpoint всё равно нужны сотни гигабайт памяти.

Можно ли отключить thinking?

Нет. Можно лишь выбрать глубину low, high или max; неизвестное значение также приводит к max.

Поддерживает ли модель изображения и видео?

Да, она принимает текст, изображения и видео и отвечает текстом. Облачный API дополнительно описывает файловый ввод.

Реален ли контекст в миллион токенов?

Он заявлен и записан в конфигурации как 1 048 576 токенов. Точность поиска по всему окну, задержку и расход памяти нужно проверять на своём сценарии.

Подходит ли GLM-5.3-Flash для одной GPU?

Официальный FP8-checkpoint занимает около 306 GiB без runtime-накладных расходов. Обычная одиночная GPU для штатного запуска недостаточна; сторонние квантизации меняют профиль качества и поддержки.

Бесплатна ли GLM-5.3-Flash?

Веса доступны бесплатно по MIT, но вычислительные ресурсы оплачивает владелец. У API действует тариф за токены, а текущие скидки и квотные акции ограничены по времени.

Источники

Где запустить модель

Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.

Обновляем провайдеров и цены…

Стоимость API

Промо до 09.09.2026: $0.075 / $0.25; затем $0.15 / $0.50 за 1M токенов, cache read $0.03 по базовому тарифу

Рассчитать сценарий →

Профиль модели

Для диаграммы пока недостаточно сопоставимых тестов.

Бенчмарки

MMVU80.5%
MVBench77.8%
NL2Repo56.3%
BabyVision53.4%
DeepSWE 1.163.4%
OfficeQA Pro62.4%
Humanity's Last Exam с инструментами55.3%
Automation Bench48.8%
Agents' Last Exam26.3%
GDPval-AA v2 (Elo)1773
Terminal-Bench 2.184.3%
Toolathlon Verified78.4%
Chartography с инструментами78%
CharXiv Reasoning с инструментами89.4%

История семейства

Линейка GLM

Последовательность собрана по датам релиза моделей Z.ai в каталоге. Она показывает соседние поколения, но не приписывает им совместимость или наследование архитектуры без отдельного источника.

Логотип Z.ai, разработчика GLM-5.2

2026-06-13

GLM-5.2

1MG 50.4
Логотип Z.ai, разработчика GLM-5.3

2026-08-14

GLM-5.3

1MG
Логотип Z.ai, разработчика GLM-5.3-FlashТекущая

2026-08-26

GLM-5.3-Flash

1MG

Экосистема GLM-5.3-Flash

Сервисы, инструменты, материалы и обсуждения, связанные с моделью.

MCP и инструменты

Весь каталог

Точных связей пока нет. Искать по разработчику.

Статьи и термины

Все статьи

Обсуждения о GLM-5.3-Flash

Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.

Создать обсуждение