К списку моделей
Логотип IBM, разработчика Granite 4.2 30B

Granite 4.2 30B

G-Score: н/д

От IBM

Open Source
FAMIBM Granite
CTX128K
PAR30B
Релиз: 2026-08-25
Open-SourceCodeReasoningAgenticText

Краткое описание

Granite 4.2 30B — крупнейшая модель новой открытой reasoning-линейки IBM для корпоративных агентов и разработки. Dense-модель поддерживает thinking, non-thinking и low-effort режимы, нативные tool calls и обучалась действовать в реальных sandbox-средах. Веса опубликованы под Apache 2.0; рабочая конфигурация использует контекст 131 072 токена.

G-Score и профиль

G-Score: н/д

Для Granite 4.2 30B пока нет совпавших результатов в подключённых публичных лидербордах. Исходные значения карточки не используются для G‑Score.

Показатели G‑Код, G‑Рассуждения, G‑Агенты и G‑Зрение рассчитаны по массовым таблицам LiveBench, Artificial Analysis и LMArena. Наведите или нажмите на значок рядом с оценкой, чтобы увидеть исходный лидерборд, вариант модели, значение и размер выборки.

Уверенность данных

низкая

Покрытие

0 тестов · 0 направлений

Происхождение

нет данных лидербордов

Как рассчитан профиль →

Место модели в каталоге

Место исходного бенчмарка показывается только при закреплённом source record и среди других карточек с источником. Эти старые значения не участвуют в G-Score лидербордов.

БенчмаркРезультатМестоДоказательство
AIME (Олимпиадная математика)89.17%1 из 1Результат разработчика
GPQA (Экспертные знания)66.41%4 из 4Результат разработчика
GDPval (native scale)12251 из 1Результат разработчика
BFCL v4 (Tool Calling)61.39%3 из 3Результат разработчика
SciCode38.76%3 из 3Результат разработчика
MMLU-Pro77.6%3 из 3Результат разработчика
BIRD Bench41.85%1 из 1Результат разработчика
ProfBench42.9%1 из 1Результат разработчика
RULER 64K89.96%1 из 1Результат разработчика
HMMT February 202589.17%1 из 1Результат разработчика
RULER 128K81.38%1 из 1Результат разработчика
SWE-bench Verified57%3 из 3Результат разработчика
Arena-Hard v267.93%1 из 1Результат разработчика
LiveCodeBench75.77%4 из 4Результат разработчика
SWE Bench Pro33.29%8 из 8Результат разработчика
IFBench prompt-level77.17%1 из 1Внутренний тест разработчика
τ³-bench average62%1 из 1Результат разработчика
Terminal-Bench 2.129.24%9 из 9Результат разработчика
MMLU-ProX lite (IBM)66.64%1 из 1Внутренний тест разработчика
SWE-Bench Multilingual41.89%5 из 5Результат разработчика

Происхождение результатов

Значения опубликованы IBM для BF16 и не переносятся автоматически на FP4/другие кванты. Таблица смешивает resolve rates, pass@1, judge-based и long-context метрики; 512K заявлено как training extension, но config и RULER подтверждают стандартный профиль до 128K.

Вариант: Granite 4.2 30B post-trained BF16 checkpoint · получено 2026-09-07

Подробный обзор модели

IBM Granite 4.2 30B — старшая плотная модель семейства Granite 4.2 для сложного reasoning, программирования и агентных сценариев. Она сочетает Apache 2.0, нативный контекст 128K, три режима рассуждения и вызов функций. Главный компромисс — высокий ресурсный порог: BF16-веса занимают около 54,5 GiB без KV-кэша и служебной памяти, поэтому полный локальный профиль рассчитан на серверный GPU-класс.

Архитектура и контекст

Granite 4.2 30B — decoder-only Transformer без MoE-маршрутизации: при генерации работает вся модель. В checkpoint 64 слоя, hidden size 4096, MLP 32768 со SwiGLU, 32 attention-head и 8 KV-head. Grouped Query Attention уменьшает KV-кэш относительно обычного multi-head attention. Используются RMSNorm, раздельные входные и выходные embeddings и BF16.

Нативная длина последовательности — 131 072 токена. IBM также заявляет long-context extension до 512K для 30B, однако стандартный config.json и опубликованная команда vLLM задают 128K, а таблица RULER заканчивается на 128K. Поэтому 512K стоит считать отдельным расширенным профилем и проверять на своих документах, а не гарантированным режимом по умолчанию.

В первоисточниках есть ещё одно расхождение: текст model card и технического блога указывает RoPE theta 10 млн, а актуальный checkpoint-конфиг — 50 млн. При развёртывании источником истины должен быть конфиг загруженной ревизии.

Как модель обучали

Готовый checkpoint получен post-training из Granite 4.1 30B Base. Базовая модель обучалась примерно на 15 трлн токенов по пятифазной схеме, где поздняя фаза добавляла длинный контекст. Supervised fine-tuning использовал около 7,2 млн примеров, примерно 100 млрд токенов, из которых около 65 млрд были trainable. Доля агентных данных составляла 31,6%; для 30B провели дополнительную SFT-фазу с усилением кода и агентных траекторий.

После SFT IBM применила последовательность независимых GRPO-этапов: задачи с проверяемой наградой, усилители instruction following и кода, затем агентные среды SWE, терминала и поиска. В них модель училась вызывать инструменты, наблюдать результат и исправлять ход решения. Финальный RLHF-этап настраивал полезность и безопасность и штрафовал чрезмерно длинные рассуждения. Генерация и обновление весов шли асинхронно через NeMo RL и NeMo Gym.

Thinking, low-effort и вызов инструментов

Один checkpoint поддерживает три режима:

РежимПараметры шаблонаКогда применять
Thinkingenable_thinking=trueматематика, код, многошаговое планирование
Non-thinkingenable_thinking=falseклассификация, извлечение, короткие ответы
Low-effortenable_thinking=true, low_effort=trueумеренное рассуждение с меньшей задержкой

Reasoning помещается в <think>...</think>. По умолчанию прежние thinking-блоки вырезаются из истории, чтобы не расходовать контекст. IBM рекомендует для всех режимов temperature=1.0 и top_p=0.95; типичный лимит ответа — 8192 токена для thinking и 2048 для non-thinking.

Инструменты описываются в OpenAI function-calling schema. Модель выбирает функцию и формирует аргументы, но поиск, терминал, база данных и контроль доступа остаются задачей оркестратора. Для vLLM нужен reasoning parser granite_thinking_parser (model card указывает v0.20+) и tool parser qwen3_coder; SGLang поддерживается с v0.5.18+. Перед production-запуском нужно тестировать JSON, повтор после ошибки инструмента и запрет опасных действий.

Локальный запуск и квантование

Официальный BF16-репозиторий содержит 58,55 GB, или 54,53 GiB, файлов весов. К этому добавляются KV-кэш, runtime и контекст, поэтому одной 64-гигабайтной карты может быть недостаточно для рабочего 128K-профиля. Для серверного API IBM показывает vLLM и SGLang, а Transformers подходит для прямого прототипа.

Опубликованы FP8, NVFP4, MXFP4 и GGUF. FP8 использует динамические per-channel weights и per-token activations без calibration. NVFP4 и MXFP4 получены GPTQ с калибровкой на 2000 SFT-примерах длиной до 2K — это важно при оценке качества длинного контекста. GGUF включает варианты от Q2_K до Q8_0; например, Q4_K_M занимает около 16,50 GiB. Есть также MLX q4/q8 для Apple Silicon. Квантование снижает память, но качество reasoning, tool calling и скорость длинного prefill нужно измерять заново.

Apache 2.0 допускает коммерческое использование, изменение и распространение при соблюдении текста лицензии и уведомлений. Самостоятельный запуск даёт контроль над данными, но переносит на владельца обновления, мониторинг, фильтрацию и инфраструктуру. Через OpenRouter проще проверить API-вариант, однако наличие модели, upstream-провайдера, контекст и цену следует сверять перед внедрением.

Бенчмарки Granite 4.2 30B

ТестРезультат
SWE-Bench Multilingual41,89
SWE-Bench Pro33,29
SWE-Bench Verified57,00
Terminal-Bench 2.129,24
τ³-bench, AVG62,00
BFCL v461,39
ProfBench / BirdBench42,90 / 41,85
AIME25 / HMMT Feb2589,17 / 89,17
GPQA / SciCode66,41 / 38,76
LiveCodeBench v675,77
MMLU-Pro / MMLU-ProX lite (IBM)77,60 / 66,64
Arena-Hard-V2 / IFBench prompt67,93 / 77,17
RULER 64K / 128K89,96 / 81,38

Это значения IBM для post-trained checkpoint, а не независимый повтор. Оценивание выполнено framework на базе NeMo Evaluator SDK; точные версии указаны только в названиях отдельных наборов, а per-benchmark agent harness и полный inference recipe не раскрыты. Смешивать resolve rate SWE-Bench, pass@1 reasoning-тестов, judge-based chat-оценки и RULER в единый «средний балл» нельзя. Таблица также не проверяет русский язык, latency, квантованные веса или заявленные 512K.

Кому подойдёт Granite 4.2 30B

Модель интересна командам, которым нужны открытые веса, permissive-лицензия и один локальный checkpoint для кода, RAG, сложного reasoning и инструментов. Для дешёвой классификации разумнее Granite 4.2 3B или 8B; 30B выбирают, когда прирост качества оправдывает сервер. Для изображений, аудио и видео нужна другая модель: Granite 4.2 30B работает с текстом.

До внедрения соберите закрытый набор русскоязычных задач, отдельно измерьте три thinking-режима, длинный контекст и каждый квант. В агентном контуре проверяйте не только формат вызова, но и конечное выполнение задачи после сбоев.

Частые вопросы

У Granite 4.2 30B открытые веса?

Да. IBM публикует checkpoint на Hugging Face под Apache 2.0, включая официальные кванты.

Какой контекст поддерживается?

Нативно — 131 072 токена. IBM заявляет расширение до 512K для 30B, но стандартный config, serving-рецепт и RULER-результаты подтверждают профиль до 128K.

Можно ли отключить reasoning?

Да. enable_thinking=false даёт прямой ответ, а low_effort=true оставляет короткое рассуждение.

Запустится ли модель на GPU с 24 GB?

GGUF Q4_K_M весит около 16,5 GiB, поэтому ограниченный запуск возможен. Но полный 128K-контекст, KV-кэш и скорость требуют отдельного расчёта; BF16 на таком GPU не помещается.

Есть ли встроенный web search?

Нет. Модель генерирует tool calls, а инструменты, permissions и выполнение предоставляет приложение.

Поддерживается ли русский язык?

Русский отсутствует в списке 12 протестированных языков IBM. Он может работать, но качество нужно проверять на собственных данных.

Можно ли использовать модель коммерчески?

Да, Apache 2.0 разрешает коммерческое использование при соблюдении условий лицензии и сохранении необходимых уведомлений.

Источники

Где запустить модель

Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.

Обновляем провайдеров и цены…

Стоимость API

Открытые веса Apache 2.0; self-hosted — расходы владельца, облачный тариф зависит от провайдера

Рассчитать сценарий →

Профиль модели

GPQA66.41%SWE-ML41.89%SWE Pro33.29%SWE Verified57%AIME89.17%

Бенчмарки

AIME (Олимпиадная математика)89.17%
GPQA (Экспертные знания)66.41%
GDPval (native scale)1225
BFCL v4 (Tool Calling)61.39%
SciCode38.76%
MMLU-Pro77.6%
BIRD Bench41.85%
ProfBench42.9%
RULER 64K89.96%
HMMT February 202589.17%
RULER 128K81.38%
SWE-bench Verified57%
Arena-Hard v267.93%
LiveCodeBench75.77%
SWE Bench Pro33.29%
IFBench prompt-level77.17%
τ³-bench average62%
Terminal-Bench 2.129.24%
MMLU-ProX lite (IBM)66.64%
SWE-Bench Multilingual41.89%

История семейства

Линейка IBM Granite

Последовательность собрана по датам релиза моделей IBM в каталоге. Она показывает соседние поколения, но не приписывает им совместимость или наследование архитектуры без отдельного источника.

Логотип IBM, разработчика Granite 4.0 Micro

2025-10-20

Granite 4.0 Micro

131KG
Логотип IBM, разработчика Granite 4.1 8B

2026-04-30

Granite 4.1 8B

131KG
Логотип IBM, разработчика Granite 4.2 30BТекущая

2026-08-25

Granite 4.2 30B

128KG

Экосистема Granite 4.2 30B

Сервисы, инструменты, материалы и обсуждения, связанные с моделью.

MCP и инструменты

Весь каталог

Точных связей пока нет. Искать по разработчику.

Статьи и термины

Все статьи

Обсуждения о Granite 4.2 30B

Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.

Создать обсуждение