К списку моделей
Логотип Tencent, разработчика Hy4 preview

Hy4 preview

G-Score: н/д

От Tencent

Open Source
FAMOther
CTX1M
PAR770B всего / 49B активных (MoE)
Релиз: 2026-08-28
PreviewFlagshipMoEOpen-SourceCodeReasoningAgentic

Краткое описание

Hy4 preview — открытая флагманская MoE-модель Tencent для разработки, офисной аналитики и научных задач. В основном блоке 770 млрд параметров и 49 млрд активных на токен; дополнительно используется MTP-слой для ускорения декодирования. Веса опубликованы под Apache 2.0, контекст — 1 048 576 токенов, однако Tencent отмечает склонность preview-версии к лишним рассуждениям и повторным проверкам.

G-Score и профиль

G-Score: н/д

Для Hy4 preview пока нет совпавших результатов в подключённых публичных лидербордах. Исходные значения карточки не используются для G‑Score.

Показатели G‑Код, G‑Рассуждения, G‑Агенты и G‑Зрение рассчитаны по массовым таблицам LiveBench, Artificial Analysis и LMArena. Наведите или нажмите на значок рядом с оценкой, чтобы увидеть исходный лидерборд, вариант модели, значение и размер выборки.

Уверенность данных

низкая

Покрытие

0 тестов · 0 направлений

Происхождение

нет данных лидербордов

Как рассчитан профиль →

Место модели в каталоге

Место исходного бенчмарка показывается только при закреплённом source record и среди других карточек с источником. Эти старые значения не участвуют в G-Score лидербордов.

БенчмаркРезультатМестоДоказательство
DeepSWE64.3%1 из 5Результат разработчика
NL2Repo58.9%2 из 8Результат разработчика
CyberGym78.4%1 из 2Результат разработчика
Humanity's Last Exam43.4%3 из 7Результат разработчика
MCP Atlas83.7%2 из 4Результат разработчика
APEX-Agents37.1%2 из 2Результат разработчика
BrokenArXiv54.6%1 из 1Результат разработчика
SkillsBench62.9%1 из 3Результат разработчика
GPQA Diamond92.3%2 из 3Результат разработчика
OfficeQA Pro66.2%1 из 3Результат разработчика
SWE Bench Pro65.7%2 из 8Результат разработчика
Humanity's Last Exam с инструментами55.4%5 из 7Результат разработчика
PostTrain Bench35.6%2 из 2Результат разработчика
Automation Bench32.1%3 из 5Результат разработчика
BioMysteryBench71.3%1 из 1Внутренний тест разработчика
GDPval-AA v2 (Elo)16784 из 8Результат разработчика
Terminal-Bench 2.185.4%5 из 9Результат разработчика
MathArena Apex 202574.2%1 из 1Результат разработчика
Toolathlon Verified74.1%3 из 8Результат разработчика
SWEAtlas Refactoring53.3%1 из 1Внутренний тест разработчика
SWEAtlas Codebase Q&A64%1 из 2Внутренний тест разработчика
SWEAtlas Test Writing57.8%1 из 1Внутренний тест разработчика
SWE-Bench Multilingual82.9%1 из 5Результат разработчика
OneMillionBench с инструментами65.4%1 из 1Внутренний тест разработчика

Происхождение результатов

Все значения опубликованы Tencent и не являются независимым воспроизведением. Agentic-тесты используют разные harness, turn budgets, timeouts, sandbox resources, judge models и anti-hacking rules; внутренние закрытые Hy-наборы исключены.

Вариант: Hy4 preview, highest available reasoning; benchmark-specific agent harness · получено 2026-09-07

Подробный обзор модели

Tencent Hy4 preview — текстовая модель с открытыми весами для coding-агентов, работы с большими наборами документов, инструментами и сложными рассуждениями. Она выделяется сочетанием 770 млрд параметров, из которых на токен активируются 49 млрд, контекста до 1 048 576 токенов и встроенного слоя Multi-Token Prediction (MTP). Через API модель стоит умеренно для своего класса, однако локальный запуск требует нескольких серверных GPU, а статус preview означает незавершённую оптимизацию и возможные изменения поведения.

Как устроена Tencent Hy4 preview

Hy4 preview выпущена 28 августа 2026 года командой Tencent Hy, ранее известной как Hunyuan. Это Mixture of Experts (MoE): запрос проходит через небольшую часть общей сети, поэтому вычислительная нагрузка ближе к модели на 49 млрд активных параметров, хотя все 770 млрд параметров весов должны находиться в памяти.

ХарактеристикаЗначение
АрхитектураMoE, 78 слоёв
Параметры основы770 млрд всего, 49 млрд активных на токен
Эксперты256 маршрутизируемых и 1 общий; top-8 на токен
Скрытая размерность6144
AttentionGated DeepSeek Sparse Attention, 64 головы
Остаточные потоки4, схема identity Hyper-Connections
Словарь120 832 токена
Контекст модели1 048 576 токенов
Модальноститекст на входе и выходе

Первый слой использует обычную плотную feed-forward network, следующие 77 — MoE-блоки. Gated DeepSeek Sparse Attention выбирает релевантные позиции вместо полного сопоставления каждого токена со всей историей. IndexCache повторно использует индексы разреженного внимания между слоями, а четыре остаточных потока iHC расширяют передачу информации по глубине сети. Эти механизмы снижают цену длинного контекста, но не устраняют расходы на загрузку весов и KV-кэш.

Отдельный MTP-слой содержит ещё 10 млрд параметров, около 0,7 млрд из них активны. Он предлагает несколько следующих токенов, после чего основная модель проверяет их за один проход. В vLLM и SGLang это используется для speculative decoding. SGLang рекомендует включать MTP для минимальной задержки чата и отключать при насыщенной пакетной нагрузке: проверка черновых токенов сама создаёт накладные расходы.

Контекст, reasoning и инструменты

Предел в 1 048 576 токенов описывает архитектуру, а не гарантированную ёмкость каждого сервера. В Tencent Cloud для hy4-preview указаны контекст 1M, максимум 960K входных и 64K выходных токенов. Endpoint поддерживает сохранённое глубокое рассуждение, structured output, function calling и кэширование. Модель текстовая: SGLang отклоняет изображения с HTTP 400.

По умолчанию локальная конфигурация использует reasoning_effort=high. Для короткого прямого ответа предусмотрен no_think; в OpenAI-совместимом клиенте его передают через chat_template_kwargs. Tencent рекомендует temperature=0.9 и top_p=1.0. Параметры полезно хранить в конфигурации приложения: preview-версия и serving runtime могут обновить собственные значения по умолчанию.

Tool calling зависит от специальных парсеров hy_v4 в vLLM либо auto в SGLang. Без них структурные токены рассуждения и вызовов инструментов могут попасть в обычный текст. Разрешения, повторы, тайм-ауты и проверку результата всё равно задаёт агентный harness — одна модель не обеспечивает безопасное выполнение команд.

Лицензия и локальный запуск

Весы BF16 и FP8 опубликованы под Apache License 2.0. Лицензия разрешает коммерческое использование, изменение и распространение при сохранении уведомлений и текста лицензии; права на товарные знаки она не предоставляет. Корректнее называть Hy4 open-weight-моделью: наличие весов не означает публикацию обучающего датасета и полного процесса обучения.

Официальный быстрый путь — Docker-образы vLLM 0.29.0+ или SGLang. Рецепт vLLM запускает tencent/Hy4-preview-FP8 с tensor parallel 8, FLASHMLA_SPARSE, MTP и отдельными парсерами. Аппаратная матрица SGLang показывает масштаб задачи:

GPUВариант и схемаРекомендованный контекст
16×H200 141 ГБ, два узлаBF16, TP16131 072
8×B200 192 ГБ, один узелMXFP8, TP8262 144
4×B300 288 ГБ, один узелMXFP8, TP4262 144
8×B300 288 ГБ, один узелBF16, TP8262 144

BF16-веса занимают около 1,5 ТБ, MXFP8 — около 760 ГБ. MXFP8-путь требует Blackwell SM100 и не работает на H200; там нужен BF16. Длинный prefill при высокой конкуренции может занять больше 30 секунд, поэтому SGLang советует клиентский тайм-аут около 300 секунд. Длительная проверка CUDA graph для смешанных агентных нагрузок ещё продолжается.

API и стоимость

Прямой Tencent Cloud использует ID hy4-preview: 6 юаней за миллион входных токенов, 18 юаней за выход и 0,3 юаня за попадание в кэш в опубликованной таблице для Гуанчжоу и Сингапура. Регион, тариф и квоты нужно перепроверять перед запуском.

Через OpenRouter ID модели — tencent/hy4-preview. Цена составляет $0,834 за миллион входных токенов, $2,501 за выход и $0,042 за cache read. OpenRouter даёт единый OpenAI-совместимый интерфейс, tools и JSON Schema, но на момент проверки у модели был один upstream — Tencent Cloud. Посредник упрощает интеграцию, однако не создаёт резервирование между независимыми площадками.

Что показывают бенчмарки

ТестHy4 previewHy3Что измеряет
SWE-bench Multilingual82,975,8исправление задач в многоязычных репозиториях
SWE-bench Pro65,757,9сложные реальные software issues
DeepSWE64,328,0агентная разработка в sandbox
Terminal-Bench 2.185,470,8выполнение задач через терминал
OneMillionBench, with tools65,451,5поиск и инструменты в длинном контексте
MCP-Atlas, public83,775,0работа с MCP-инструментами
OfficeQA Pro66,254,1офисные и аналитические задачи
GPQA Diamond92,390,9сложные научные вопросы

Все значения опубликованы Tencent и пока не являются независимой репликацией. Метаданные Hugging Face были импортированы автоматическим запросом из той же model card, поэтому это не второй прогон.

У тестов различаются окружения. SWE-bench Pro и Multilingual запускались со scaffold swe-agent, DeepSWE — с mini-swe-agent в sandbox на 8 CPU и 16 ГБ памяти. Terminal-Bench 2.1 использовал Claude Code harness, до 500 ходов и 12 часов на задачу. MCP-Atlas оценивался на публичных 500 заданиях с лимитом 100 tool calls и судьёй Gemini 3.1 Pro Preview. Tencent брала максимально доступный уровень reasoning; часть результатов конкурентов компания тестировала сама. Поэтому таблица показывает направление силы Hy4, но не ожидаемый процент успеха в вашем агенте.

Для каких задач выбирать Hy4 preview

Модель стоит тестировать для исправления связанных ошибок в большом репозитории, рефакторинга с инструментами, анализа множества текстовых файлов, подготовки документов и таблиц, финансовых расчётов и научных задач. Для production-eval считайте долю принятых изменений, количество повторов и tool calls, задержку, стоимость готового результата и ошибки после ревью.

Hy4 особенно интересна, если нужны открытые веса и можно выделить серверный кластер. API рациональнее для пилота, переменной нагрузки и полного миллионного контекста. Более компактная модель выгоднее для классификации, коротких ответов и локальной рабочей станции. Отдельная vision-модель нужна для изображений и сканов.

Главные ограничения preview — склонность рассуждать дольше необходимого и чрезмерно перепроверять работу, огромный объём весов, text-only ввод и отсутствие независимой серии benchmark-прогонов. Перед production-запуском закрепите ревизию весов и runtime, ограничьте шаги агента и бюджет токенов, а затем повторите собственный eval после каждого обновления.

FAQ

Можно ли запустить Hy4 preview на одной видеокарте?

Официальные конфигурации требуют минимум четырёх B300 для FP8. Одноплатный запуск не входит в проверенную Tencent/SGLang матрицу.

Поддерживает ли модель изображения?

Нет. Hy4 preview принимает и возвращает текст; SGLang намеренно отвечает HTTP 400 на image input.

Чем 770B отличается от 49B active?

770 млрд — общий объём весов, который нужно хранить. MoE-маршрутизатор использует около 49 млрд параметров при обработке конкретного токена, снижая вычисления.

MTP улучшает качество ответа?

Его основная задача — ускорить декодирование. Выигрыш зависит от нагрузки: для чата MTP полезен, а при насыщенном batch serving может мешать throughput.

Реален ли контекст 1M при self-hosting?

Архитектура его поддерживает, но официальные локальные рецепты ограничивают контекст доступным KV-кэшем: обычно 131K или 262K в проверенных конфигурациях.

Какой ID у модели в API?

В Tencent Cloud — hy4-preview, в OpenRouter — tencent/hy4-preview. Локальный сервер может публиковать имя hy4-preview через OpenAI-совместимый endpoint.

Готова ли Hy4 preview для production?

Технически её можно развернуть, но Tencent называет релиз ранним. Нужны собственные eval, лимиты агента, мониторинг задержки и закреплённые версии весов и runtime.

Источники

Где запустить модель

Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.

Обновляем провайдеров и цены…

Стоимость API

Открытые веса Apache 2.0; self-hosted — расходы владельца, тариф API зависит от провайдера

Рассчитать сценарий →

Профиль модели

SWE-ML82.9%SWE Pro65.7%DeepSWE64.3%

Бенчмарки

DeepSWE64.3%
NL2Repo58.9%
CyberGym78.4%
Humanity's Last Exam43.4%
MCP Atlas83.7%
APEX-Agents37.1%
BrokenArXiv54.6%
SkillsBench62.9%
GPQA Diamond92.3%
OfficeQA Pro66.2%
SWE Bench Pro65.7%
Humanity's Last Exam с инструментами55.4%
PostTrain Bench35.6%
Automation Bench32.1%
BioMysteryBench71.3%
GDPval-AA v2 (Elo)1678
Terminal-Bench 2.185.4%
MathArena Apex 202574.2%
Toolathlon Verified74.1%
SWEAtlas Refactoring53.3%
SWEAtlas Codebase Q&A64%
SWEAtlas Test Writing57.8%
SWE-Bench Multilingual82.9%
OneMillionBench с инструментами65.4%

История семейства

Линейка Other

Последовательность собрана по датам релиза моделей Tencent в каталоге. Она показывает соседние поколения, но не приписывает им совместимость или наследование архитектуры без отдельного источника.

Экосистема Hy4 preview

Сервисы, инструменты, материалы и обсуждения, связанные с моделью.

MCP и инструменты

Весь каталог

Точных связей пока нет. Искать по разработчику.

Статьи и термины

Все статьи

Обсуждения о Hy4 preview

Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.

Создать обсуждение