Текущая2026-08-28

От Tencent
Hy4 preview — открытая флагманская MoE-модель Tencent для разработки, офисной аналитики и научных задач. В основном блоке 770 млрд параметров и 49 млрд активных на токен; дополнительно используется MTP-слой для ускорения декодирования. Веса опубликованы под Apache 2.0, контекст — 1 048 576 токенов, однако Tencent отмечает склонность preview-версии к лишним рассуждениям и повторным проверкам.
Для Hy4 preview пока нет совпавших результатов в подключённых публичных лидербордах. Исходные значения карточки не используются для G‑Score.
Показатели G‑Код, G‑Рассуждения, G‑Агенты и G‑Зрение рассчитаны по массовым таблицам LiveBench, Artificial Analysis и LMArena. Наведите или нажмите на значок рядом с оценкой, чтобы увидеть исходный лидерборд, вариант модели, значение и размер выборки.
Уверенность данных
низкая
Покрытие
0 тестов · 0 направлений
Происхождение
нет данных лидербордов
Место исходного бенчмарка показывается только при закреплённом source record и среди других карточек с источником. Эти старые значения не участвуют в G-Score лидербордов.
| Бенчмарк | Результат | Место | Доказательство |
|---|---|---|---|
| DeepSWE | 64.3% | 1 из 5 | Результат разработчика |
| NL2Repo | 58.9% | 2 из 8 | Результат разработчика |
| CyberGym | 78.4% | 1 из 2 | Результат разработчика |
| Humanity's Last Exam | 43.4% | 3 из 7 | Результат разработчика |
| MCP Atlas | 83.7% | 2 из 4 | Результат разработчика |
| APEX-Agents | 37.1% | 2 из 2 | Результат разработчика |
| BrokenArXiv | 54.6% | 1 из 1 | Результат разработчика |
| SkillsBench | 62.9% | 1 из 3 | Результат разработчика |
| GPQA Diamond | 92.3% | 2 из 3 | Результат разработчика |
| OfficeQA Pro | 66.2% | 1 из 3 | Результат разработчика |
| SWE Bench Pro | 65.7% | 2 из 8 | Результат разработчика |
| Humanity's Last Exam с инструментами | 55.4% | 5 из 7 | Результат разработчика |
| PostTrain Bench | 35.6% | 2 из 2 | Результат разработчика |
| Automation Bench | 32.1% | 3 из 5 | Результат разработчика |
| BioMysteryBench | 71.3% | 1 из 1 | Внутренний тест разработчика |
| GDPval-AA v2 (Elo) | 1678 | 4 из 8 | Результат разработчика |
| Terminal-Bench 2.1 | 85.4% | 5 из 9 | Результат разработчика |
| MathArena Apex 2025 | 74.2% | 1 из 1 | Результат разработчика |
| Toolathlon Verified | 74.1% | 3 из 8 | Результат разработчика |
| SWEAtlas Refactoring | 53.3% | 1 из 1 | Внутренний тест разработчика |
| SWEAtlas Codebase Q&A | 64% | 1 из 2 | Внутренний тест разработчика |
| SWEAtlas Test Writing | 57.8% | 1 из 1 | Внутренний тест разработчика |
| SWE-Bench Multilingual | 82.9% | 1 из 5 | Результат разработчика |
| OneMillionBench с инструментами | 65.4% | 1 из 1 | Внутренний тест разработчика |
Происхождение результатов
Все значения опубликованы Tencent и не являются независимым воспроизведением. Agentic-тесты используют разные harness, turn budgets, timeouts, sandbox resources, judge models и anti-hacking rules; внутренние закрытые Hy-наборы исключены.
Вариант: Hy4 preview, highest available reasoning; benchmark-specific agent harness · получено 2026-09-07
Tencent Hy4 preview — текстовая модель с открытыми весами для coding-агентов, работы с большими наборами документов, инструментами и сложными рассуждениями. Она выделяется сочетанием 770 млрд параметров, из которых на токен активируются 49 млрд, контекста до 1 048 576 токенов и встроенного слоя Multi-Token Prediction (MTP). Через API модель стоит умеренно для своего класса, однако локальный запуск требует нескольких серверных GPU, а статус preview означает незавершённую оптимизацию и возможные изменения поведения.
Hy4 preview выпущена 28 августа 2026 года командой Tencent Hy, ранее известной как Hunyuan. Это Mixture of Experts (MoE): запрос проходит через небольшую часть общей сети, поэтому вычислительная нагрузка ближе к модели на 49 млрд активных параметров, хотя все 770 млрд параметров весов должны находиться в памяти.
| Характеристика | Значение |
|---|---|
| Архитектура | MoE, 78 слоёв |
| Параметры основы | 770 млрд всего, 49 млрд активных на токен |
| Эксперты | 256 маршрутизируемых и 1 общий; top-8 на токен |
| Скрытая размерность | 6144 |
| Attention | Gated DeepSeek Sparse Attention, 64 головы |
| Остаточные потоки | 4, схема identity Hyper-Connections |
| Словарь | 120 832 токена |
| Контекст модели | 1 048 576 токенов |
| Модальности | текст на входе и выходе |
Первый слой использует обычную плотную feed-forward network, следующие 77 — MoE-блоки. Gated DeepSeek Sparse Attention выбирает релевантные позиции вместо полного сопоставления каждого токена со всей историей. IndexCache повторно использует индексы разреженного внимания между слоями, а четыре остаточных потока iHC расширяют передачу информации по глубине сети. Эти механизмы снижают цену длинного контекста, но не устраняют расходы на загрузку весов и KV-кэш.
Отдельный MTP-слой содержит ещё 10 млрд параметров, около 0,7 млрд из них активны. Он предлагает несколько следующих токенов, после чего основная модель проверяет их за один проход. В vLLM и SGLang это используется для speculative decoding. SGLang рекомендует включать MTP для минимальной задержки чата и отключать при насыщенной пакетной нагрузке: проверка черновых токенов сама создаёт накладные расходы.
Предел в 1 048 576 токенов описывает архитектуру, а не гарантированную ёмкость каждого сервера. В Tencent Cloud для hy4-preview указаны контекст 1M, максимум 960K входных и 64K выходных токенов. Endpoint поддерживает сохранённое глубокое рассуждение, structured output, function calling и кэширование. Модель текстовая: SGLang отклоняет изображения с HTTP 400.
По умолчанию локальная конфигурация использует reasoning_effort=high. Для короткого прямого ответа предусмотрен no_think; в OpenAI-совместимом клиенте его передают через chat_template_kwargs. Tencent рекомендует temperature=0.9 и top_p=1.0. Параметры полезно хранить в конфигурации приложения: preview-версия и serving runtime могут обновить собственные значения по умолчанию.
Tool calling зависит от специальных парсеров hy_v4 в vLLM либо auto в SGLang. Без них структурные токены рассуждения и вызовов инструментов могут попасть в обычный текст. Разрешения, повторы, тайм-ауты и проверку результата всё равно задаёт агентный harness — одна модель не обеспечивает безопасное выполнение команд.
Весы BF16 и FP8 опубликованы под Apache License 2.0. Лицензия разрешает коммерческое использование, изменение и распространение при сохранении уведомлений и текста лицензии; права на товарные знаки она не предоставляет. Корректнее называть Hy4 open-weight-моделью: наличие весов не означает публикацию обучающего датасета и полного процесса обучения.
Официальный быстрый путь — Docker-образы vLLM 0.29.0+ или SGLang. Рецепт vLLM запускает tencent/Hy4-preview-FP8 с tensor parallel 8, FLASHMLA_SPARSE, MTP и отдельными парсерами. Аппаратная матрица SGLang показывает масштаб задачи:
| GPU | Вариант и схема | Рекомендованный контекст |
|---|---|---|
| 16×H200 141 ГБ, два узла | BF16, TP16 | 131 072 |
| 8×B200 192 ГБ, один узел | MXFP8, TP8 | 262 144 |
| 4×B300 288 ГБ, один узел | MXFP8, TP4 | 262 144 |
| 8×B300 288 ГБ, один узел | BF16, TP8 | 262 144 |
BF16-веса занимают около 1,5 ТБ, MXFP8 — около 760 ГБ. MXFP8-путь требует Blackwell SM100 и не работает на H200; там нужен BF16. Длинный prefill при высокой конкуренции может занять больше 30 секунд, поэтому SGLang советует клиентский тайм-аут около 300 секунд. Длительная проверка CUDA graph для смешанных агентных нагрузок ещё продолжается.
Прямой Tencent Cloud использует ID hy4-preview: 6 юаней за миллион входных токенов, 18 юаней за выход и 0,3 юаня за попадание в кэш в опубликованной таблице для Гуанчжоу и Сингапура. Регион, тариф и квоты нужно перепроверять перед запуском.
Через OpenRouter ID модели — tencent/hy4-preview. Цена составляет $0,834 за миллион входных токенов, $2,501 за выход и $0,042 за cache read. OpenRouter даёт единый OpenAI-совместимый интерфейс, tools и JSON Schema, но на момент проверки у модели был один upstream — Tencent Cloud. Посредник упрощает интеграцию, однако не создаёт резервирование между независимыми площадками.
| Тест | Hy4 preview | Hy3 | Что измеряет |
|---|---|---|---|
| SWE-bench Multilingual | 82,9 | 75,8 | исправление задач в многоязычных репозиториях |
| SWE-bench Pro | 65,7 | 57,9 | сложные реальные software issues |
| DeepSWE | 64,3 | 28,0 | агентная разработка в sandbox |
| Terminal-Bench 2.1 | 85,4 | 70,8 | выполнение задач через терминал |
| OneMillionBench, with tools | 65,4 | 51,5 | поиск и инструменты в длинном контексте |
| MCP-Atlas, public | 83,7 | 75,0 | работа с MCP-инструментами |
| OfficeQA Pro | 66,2 | 54,1 | офисные и аналитические задачи |
| GPQA Diamond | 92,3 | 90,9 | сложные научные вопросы |
Все значения опубликованы Tencent и пока не являются независимой репликацией. Метаданные Hugging Face были импортированы автоматическим запросом из той же model card, поэтому это не второй прогон.
У тестов различаются окружения. SWE-bench Pro и Multilingual запускались со scaffold swe-agent, DeepSWE — с mini-swe-agent в sandbox на 8 CPU и 16 ГБ памяти. Terminal-Bench 2.1 использовал Claude Code harness, до 500 ходов и 12 часов на задачу. MCP-Atlas оценивался на публичных 500 заданиях с лимитом 100 tool calls и судьёй Gemini 3.1 Pro Preview. Tencent брала максимально доступный уровень reasoning; часть результатов конкурентов компания тестировала сама. Поэтому таблица показывает направление силы Hy4, но не ожидаемый процент успеха в вашем агенте.
Модель стоит тестировать для исправления связанных ошибок в большом репозитории, рефакторинга с инструментами, анализа множества текстовых файлов, подготовки документов и таблиц, финансовых расчётов и научных задач. Для production-eval считайте долю принятых изменений, количество повторов и tool calls, задержку, стоимость готового результата и ошибки после ревью.
Hy4 особенно интересна, если нужны открытые веса и можно выделить серверный кластер. API рациональнее для пилота, переменной нагрузки и полного миллионного контекста. Более компактная модель выгоднее для классификации, коротких ответов и локальной рабочей станции. Отдельная vision-модель нужна для изображений и сканов.
Главные ограничения preview — склонность рассуждать дольше необходимого и чрезмерно перепроверять работу, огромный объём весов, text-only ввод и отсутствие независимой серии benchmark-прогонов. Перед production-запуском закрепите ревизию весов и runtime, ограничьте шаги агента и бюджет токенов, а затем повторите собственный eval после каждого обновления.
Официальные конфигурации требуют минимум четырёх B300 для FP8. Одноплатный запуск не входит в проверенную Tencent/SGLang матрицу.
Нет. Hy4 preview принимает и возвращает текст; SGLang намеренно отвечает HTTP 400 на image input.
770 млрд — общий объём весов, который нужно хранить. MoE-маршрутизатор использует около 49 млрд параметров при обработке конкретного токена, снижая вычисления.
Его основная задача — ускорить декодирование. Выигрыш зависит от нагрузки: для чата MTP полезен, а при насыщенном batch serving может мешать throughput.
Архитектура его поддерживает, но официальные локальные рецепты ограничивают контекст доступным KV-кэшем: обычно 131K или 262K в проверенных конфигурациях.
В Tencent Cloud — hy4-preview, в OpenRouter — tencent/hy4-preview. Локальный сервер может публиковать имя hy4-preview через OpenAI-совместимый endpoint.
Технически её можно развернуть, но Tencent называет релиз ранним. Нужны собственные eval, лимиты агента, мониторинг задержки и закреплённые версии весов и runtime.
Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.
Открытые веса Apache 2.0; self-hosted — расходы владельца, тариф API зависит от провайдера
Рассчитать сценарий →История семейства
Последовательность собрана по датам релиза моделей Tencent в каталоге. Она показывает соседние поколения, но не приписывает им совместимость или наследование архитектуры без отдельного источника.

2025-07-08

2026-04-22
Текущая2026-08-28
Сервисы, инструменты, материалы и обсуждения, связанные с моделью.
Точных связей пока нет. Искать по разработчику.
Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.