Текущая2026-08-25

От IBM
Granite 4.2 30B — крупнейшая модель новой открытой reasoning-линейки IBM для корпоративных агентов и разработки. Dense-модель поддерживает thinking, non-thinking и low-effort режимы, нативные tool calls и обучалась действовать в реальных sandbox-средах. Веса опубликованы под Apache 2.0; рабочая конфигурация использует контекст 131 072 токена.
Для Granite 4.2 30B пока нет совпавших результатов в подключённых публичных лидербордах. Исходные значения карточки не используются для G‑Score.
Показатели G‑Код, G‑Рассуждения, G‑Агенты и G‑Зрение рассчитаны по массовым таблицам LiveBench, Artificial Analysis и LMArena. Наведите или нажмите на значок рядом с оценкой, чтобы увидеть исходный лидерборд, вариант модели, значение и размер выборки.
Уверенность данных
низкая
Покрытие
0 тестов · 0 направлений
Происхождение
нет данных лидербордов
Место исходного бенчмарка показывается только при закреплённом source record и среди других карточек с источником. Эти старые значения не участвуют в G-Score лидербордов.
| Бенчмарк | Результат | Место | Доказательство |
|---|---|---|---|
| AIME (Олимпиадная математика) | 89.17% | 1 из 1 | Результат разработчика |
| GPQA (Экспертные знания) | 66.41% | 4 из 4 | Результат разработчика |
| GDPval (native scale) | 1225 | 1 из 1 | Результат разработчика |
| BFCL v4 (Tool Calling) | 61.39% | 3 из 3 | Результат разработчика |
| SciCode | 38.76% | 3 из 3 | Результат разработчика |
| MMLU-Pro | 77.6% | 3 из 3 | Результат разработчика |
| BIRD Bench | 41.85% | 1 из 1 | Результат разработчика |
| ProfBench | 42.9% | 1 из 1 | Результат разработчика |
| RULER 64K | 89.96% | 1 из 1 | Результат разработчика |
| HMMT February 2025 | 89.17% | 1 из 1 | Результат разработчика |
| RULER 128K | 81.38% | 1 из 1 | Результат разработчика |
| SWE-bench Verified | 57% | 3 из 3 | Результат разработчика |
| Arena-Hard v2 | 67.93% | 1 из 1 | Результат разработчика |
| LiveCodeBench | 75.77% | 4 из 4 | Результат разработчика |
| SWE Bench Pro | 33.29% | 8 из 8 | Результат разработчика |
| IFBench prompt-level | 77.17% | 1 из 1 | Внутренний тест разработчика |
| τ³-bench average | 62% | 1 из 1 | Результат разработчика |
| Terminal-Bench 2.1 | 29.24% | 9 из 9 | Результат разработчика |
| MMLU-ProX lite (IBM) | 66.64% | 1 из 1 | Внутренний тест разработчика |
| SWE-Bench Multilingual | 41.89% | 5 из 5 | Результат разработчика |
Происхождение результатов
Значения опубликованы IBM для BF16 и не переносятся автоматически на FP4/другие кванты. Таблица смешивает resolve rates, pass@1, judge-based и long-context метрики; 512K заявлено как training extension, но config и RULER подтверждают стандартный профиль до 128K.
Вариант: Granite 4.2 30B post-trained BF16 checkpoint · получено 2026-09-07
IBM Granite 4.2 30B — старшая плотная модель семейства Granite 4.2 для сложного reasoning, программирования и агентных сценариев. Она сочетает Apache 2.0, нативный контекст 128K, три режима рассуждения и вызов функций. Главный компромисс — высокий ресурсный порог: BF16-веса занимают около 54,5 GiB без KV-кэша и служебной памяти, поэтому полный локальный профиль рассчитан на серверный GPU-класс.
Granite 4.2 30B — decoder-only Transformer без MoE-маршрутизации: при генерации работает вся модель. В checkpoint 64 слоя, hidden size 4096, MLP 32768 со SwiGLU, 32 attention-head и 8 KV-head. Grouped Query Attention уменьшает KV-кэш относительно обычного multi-head attention. Используются RMSNorm, раздельные входные и выходные embeddings и BF16.
Нативная длина последовательности — 131 072 токена. IBM также заявляет long-context extension до 512K для 30B, однако стандартный config.json и опубликованная команда vLLM задают 128K, а таблица RULER заканчивается на 128K. Поэтому 512K стоит считать отдельным расширенным профилем и проверять на своих документах, а не гарантированным режимом по умолчанию.
В первоисточниках есть ещё одно расхождение: текст model card и технического блога указывает RoPE theta 10 млн, а актуальный checkpoint-конфиг — 50 млн. При развёртывании источником истины должен быть конфиг загруженной ревизии.
Готовый checkpoint получен post-training из Granite 4.1 30B Base. Базовая модель обучалась примерно на 15 трлн токенов по пятифазной схеме, где поздняя фаза добавляла длинный контекст. Supervised fine-tuning использовал около 7,2 млн примеров, примерно 100 млрд токенов, из которых около 65 млрд были trainable. Доля агентных данных составляла 31,6%; для 30B провели дополнительную SFT-фазу с усилением кода и агентных траекторий.
После SFT IBM применила последовательность независимых GRPO-этапов: задачи с проверяемой наградой, усилители instruction following и кода, затем агентные среды SWE, терминала и поиска. В них модель училась вызывать инструменты, наблюдать результат и исправлять ход решения. Финальный RLHF-этап настраивал полезность и безопасность и штрафовал чрезмерно длинные рассуждения. Генерация и обновление весов шли асинхронно через NeMo RL и NeMo Gym.
Один checkpoint поддерживает три режима:
| Режим | Параметры шаблона | Когда применять |
|---|---|---|
| Thinking | enable_thinking=true | математика, код, многошаговое планирование |
| Non-thinking | enable_thinking=false | классификация, извлечение, короткие ответы |
| Low-effort | enable_thinking=true, low_effort=true | умеренное рассуждение с меньшей задержкой |
Reasoning помещается в <think>...</think>. По умолчанию прежние thinking-блоки вырезаются из истории, чтобы не расходовать контекст. IBM рекомендует для всех режимов temperature=1.0 и top_p=0.95; типичный лимит ответа — 8192 токена для thinking и 2048 для non-thinking.
Инструменты описываются в OpenAI function-calling schema. Модель выбирает функцию и формирует аргументы, но поиск, терминал, база данных и контроль доступа остаются задачей оркестратора. Для vLLM нужен reasoning parser granite_thinking_parser (model card указывает v0.20+) и tool parser qwen3_coder; SGLang поддерживается с v0.5.18+. Перед production-запуском нужно тестировать JSON, повтор после ошибки инструмента и запрет опасных действий.
Официальный BF16-репозиторий содержит 58,55 GB, или 54,53 GiB, файлов весов. К этому добавляются KV-кэш, runtime и контекст, поэтому одной 64-гигабайтной карты может быть недостаточно для рабочего 128K-профиля. Для серверного API IBM показывает vLLM и SGLang, а Transformers подходит для прямого прототипа.
Опубликованы FP8, NVFP4, MXFP4 и GGUF. FP8 использует динамические per-channel weights и per-token activations без calibration. NVFP4 и MXFP4 получены GPTQ с калибровкой на 2000 SFT-примерах длиной до 2K — это важно при оценке качества длинного контекста. GGUF включает варианты от Q2_K до Q8_0; например, Q4_K_M занимает около 16,50 GiB. Есть также MLX q4/q8 для Apple Silicon. Квантование снижает память, но качество reasoning, tool calling и скорость длинного prefill нужно измерять заново.
Apache 2.0 допускает коммерческое использование, изменение и распространение при соблюдении текста лицензии и уведомлений. Самостоятельный запуск даёт контроль над данными, но переносит на владельца обновления, мониторинг, фильтрацию и инфраструктуру. Через OpenRouter проще проверить API-вариант, однако наличие модели, upstream-провайдера, контекст и цену следует сверять перед внедрением.
| Тест | Результат |
|---|---|
| SWE-Bench Multilingual | 41,89 |
| SWE-Bench Pro | 33,29 |
| SWE-Bench Verified | 57,00 |
| Terminal-Bench 2.1 | 29,24 |
| τ³-bench, AVG | 62,00 |
| BFCL v4 | 61,39 |
| ProfBench / BirdBench | 42,90 / 41,85 |
| AIME25 / HMMT Feb25 | 89,17 / 89,17 |
| GPQA / SciCode | 66,41 / 38,76 |
| LiveCodeBench v6 | 75,77 |
| MMLU-Pro / MMLU-ProX lite (IBM) | 77,60 / 66,64 |
| Arena-Hard-V2 / IFBench prompt | 67,93 / 77,17 |
| RULER 64K / 128K | 89,96 / 81,38 |
Это значения IBM для post-trained checkpoint, а не независимый повтор. Оценивание выполнено framework на базе NeMo Evaluator SDK; точные версии указаны только в названиях отдельных наборов, а per-benchmark agent harness и полный inference recipe не раскрыты. Смешивать resolve rate SWE-Bench, pass@1 reasoning-тестов, judge-based chat-оценки и RULER в единый «средний балл» нельзя. Таблица также не проверяет русский язык, latency, квантованные веса или заявленные 512K.
Модель интересна командам, которым нужны открытые веса, permissive-лицензия и один локальный checkpoint для кода, RAG, сложного reasoning и инструментов. Для дешёвой классификации разумнее Granite 4.2 3B или 8B; 30B выбирают, когда прирост качества оправдывает сервер. Для изображений, аудио и видео нужна другая модель: Granite 4.2 30B работает с текстом.
До внедрения соберите закрытый набор русскоязычных задач, отдельно измерьте три thinking-режима, длинный контекст и каждый квант. В агентном контуре проверяйте не только формат вызова, но и конечное выполнение задачи после сбоев.
Да. IBM публикует checkpoint на Hugging Face под Apache 2.0, включая официальные кванты.
Нативно — 131 072 токена. IBM заявляет расширение до 512K для 30B, но стандартный config, serving-рецепт и RULER-результаты подтверждают профиль до 128K.
Да. enable_thinking=false даёт прямой ответ, а low_effort=true оставляет короткое рассуждение.
GGUF Q4_K_M весит около 16,5 GiB, поэтому ограниченный запуск возможен. Но полный 128K-контекст, KV-кэш и скорость требуют отдельного расчёта; BF16 на таком GPU не помещается.
Нет. Модель генерирует tool calls, а инструменты, permissions и выполнение предоставляет приложение.
Русский отсутствует в списке 12 протестированных языков IBM. Он может работать, но качество нужно проверять на собственных данных.
Да, Apache 2.0 разрешает коммерческое использование при соблюдении условий лицензии и сохранении необходимых уведомлений.
Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.
Открытые веса Apache 2.0; self-hosted — расходы владельца, облачный тариф зависит от провайдера
Рассчитать сценарий →История семейства
Последовательность собрана по датам релиза моделей IBM в каталоге. Она показывает соседние поколения, но не приписывает им совместимость или наследование архитектуры без отдельного источника.

2025-10-20

2026-04-30
Текущая2026-08-25
Сервисы, инструменты, материалы и обсуждения, связанные с моделью.
Точных связей пока нет. Искать по разработчику.
Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.