
Бесплатная модель Nemotron Ultra от NVIDIA: где и как применить
На 6 сентября 2026 года под Nemotron Ultra нужно понимать NVIDIA-Nemotron-3-Ultra-550B-A55B — текстовую reasoning-модель NVIDIA с 550 млрд параметров, из которых до 55 млрд активируются для каждого токена.

На 6 сентября 2026 года под Nemotron Ultra нужно понимать NVIDIA-Nemotron-3-Ultra-550B-A55B — текстовую reasoning-модель NVIDIA с 550 млрд параметров, из которых до 55 млрд активируются для каждого токена. Бесплатны её веса и права на использование по OpenMDW-1.1, а также ограниченный API для прототипов. Вычисления в продакшене бесплатными не становятся: после теста придётся платить провайдеру за токены, арендовать GPU или содержать собственный кластер. Ultra стоит выбирать для сложного планирования, кода, исследований, длинных документов и агентных сценариев; для обычного чата и массовых простых запросов она избыточна.
Какая модель сейчас называется Nemotron Ultra
Актуальная версия вышла 4 июня 2026 года. Её полное имя — NVIDIA-Nemotron-3-Ultra-550B-A55B. В старых инструкциях и каталогах всё ещё встречается Llama-3.1-Nemotron-Ultra-253B-v1, выпущенная в 2025 году. Это другая модель с иным размером, архитектурой и API-идентификатором.
| Характеристика | Nemotron 3 Ultra 550B-A55B |
|---|---|
| Разработчик | NVIDIA |
| Дата релиза | 4 июня 2026 года |
| Параметры | 550 млрд всего, до 55 млрд активных на токен |
| Архитектура | гибрид Mamba-2 и Attention, Latent Mixture-of-Experts, Multi-Token Prediction |
| Модальности | текст на входе, текст на выходе |
| Контекст | 262 144 токена по умолчанию в NIM; до 1 048 576 в расширенном режиме |
| Максимальный ответ в NVIDIA hosted API | 32 768 токенов; значение по умолчанию — 16 384 |
| Reasoning | включается и выключается, бюджет рассуждения можно ограничивать |
| Инструменты | function calling поддерживается |
| Структурированный вывод | на текущем NVIDIA Build endpoint помечен как неподдерживаемый; локальный NIM умеет JSON mode при подходящей конфигурации |
| Лицензия весов | OpenMDW-1.1, коммерческое и некоммерческое применение |
| Официально перечисленные языки | английский, французский, испанский, итальянский, немецкий, японский, корейский, хинди, бразильский португальский, китайский |
Число A55B описывает вычислительную нагрузку одного шага, но не объём модели в памяти. Архитектура Mixture-of-Experts выбирает часть экспертов для текущего токена, однако все 550 млрд параметров нужно хранить на GPU, в оперативной памяти при offload или в распределённом хранилище. Поэтому Ultra нельзя оценивать как обычную модель на 55 млрд параметров.
В каталоге NVIDIA рядом с именем встречается значение 561B, тогда как Model Card, технический отчёт и имя checkpoint указывают 550B. NVIDIA не объясняет расхождение. Для планирования стоит использовать официальный класс 550B и проверять фактический профиль NIM перед закупкой оборудования.
Какой checkpoint нужен
| Вариант | Для чего предназначен | Практическое замечание |
|---|---|---|
...-NVFP4 |
готовый chat/reasoning, уменьшенный memory footprint | основной вариант для Blackwell; на Hopper используется совместимый путь без всех преимуществ нативного FP4 |
...-BF16 |
готовый post-trained chat/reasoning | максимальная точность без 4-битного сжатия, но очень высокий расход памяти |
...-Base-BF16 |
продолжение предобучения и собственный post-training | как готовый ассистент не подходит |
...-GenRM |
reward model для обучения с подкреплением | не заменяет генеративную Ultra |
Что здесь действительно бесплатно
У слова «бесплатная» четыре разных значения. Их полезно разделить до выбора архитектуры.
| Вариант | Что можно получить без оплаты | Главные ограничения |
|---|---|---|
| Веса OpenMDW-1.1 | скачать, запускать, изменять и применять коммерчески | нужны сотни гигабайт хранилища и дорогие GPU; при распространении сохраняются лицензия и notices |
| NVIDIA Build | прототипный endpoint без оплаты за токены | до 40 запросов в минуту для большинства моделей, персональный лимит и доступность; данные trial записываются |
OpenRouter :free |
бесплатный маршрут к Ultra на дату проверки | 20 запросов в минуту и суточный лимит, общая мощность, маршрут может исчезнуть |
| NIM для разработки | контейнер и оптимизированный serving для dev/test | продакшен требует NVIDIA AI Enterprise либо облачную production-лицензию |
OpenMDW-1.1 даёт широкие права на Model Materials без лицензионной платы. Разрешены использование, изменение и распространение. Если вы передаёте сами веса или другие части Model Materials, нужно приложить текст лицензии и сохранить применимые уведомления об авторстве и происхождении. Для сгенерированного результата дополнительных условий в лицензии нет. Лицензия предоставляется без гарантий, а проверять права третьих лиц и законность конкретного применения должен оператор. Полный текст лучше сверить перед релизом продукта в OpenMDW-1.1. Разобраться в различиях лицензии и открытых весов помогает статья о разнице между открытыми весами и закрытыми ИИ.
Модельная лицензия не оплачивает инфраструктуру. Даже если использовать открытый vLLM или SGLang вместо NIM, останутся расходы на GPU, электричество, накопители, сеть, инженеров и мониторинг.
Бесплатный API NVIDIA
Build.NVIDIA.com разрешает тестировать модели бесплатно и сообщает лимит до 40 RPM — запросов в минуту — для большинства моделей. Точный персональный предел показывается в аккаунте. Это среда прототипирования без обещания бессрочной доступности, выделенной мощности или производственного соглашения об уровне сервиса.
Для Ultra действует важное предупреждение о данных: NVIDIA записывает вход и выход для предоставления trial, контроля безопасности и улучшения продуктов и сервисов, включая AI-модели. В бесплатный endpoint нельзя отправлять пароли, приватные репозитории, договоры, клиентские базы, медицинские сведения и персональные данные. Фиксированный срок хранения для этой модели в публичной карточке не указан.
Бесплатный маршрут OpenRouter
На дату проверки доступен ID nvidia/nemotron-3-ultra-550b-a55b:free. Общие ограничения OpenRouter для моделей с суффиксом :free такие:
- 20 запросов в минуту;
- 50 запросов в сутки, если за всё время куплено менее $10 credits;
- 1000 запросов в сутки после покупки не менее $10 credits.
Покупка credits повышает суточный лимит, хотя сами запросы к free-route остаются бесплатными. На маршруте действует предупреждение NVIDIA о записи данных. Мощность делится между пользователями, поэтому возможны очереди, ошибки апстрима и временное отсутствие модели.
Для каких задач подходит Ultra
Nemotron 3 Ultra создавалась как верхний уровень агентной системы. Её выгоднее вызывать в редких сложных точках, а рутинные операции отдавать меньшей модели.
| Задача | Пригодность | Как применять |
|---|---|---|
| Планирование сложного проекта | высокая | построить план, выявить зависимости, проверить ограничения, затем передать этапы исполнителям |
| Работа с большим репозиторием | высокая | анализ архитектуры, поиск причины дефекта, план патча; выполнение кода — только в sandbox с тестами |
| Deep research | высокая | синтез нескольких источников, противоречия, вопросы для проверки; факты подтверждать ссылками |
| Длинные документы и RAG | высокая | анализировать отобранные фрагменты, цитировать источник, проверять ответы retrieval-слоем |
| Математика и наука | высокая | включить ограниченный reasoning budget, затем проверить вычисления отдельным инструментом |
| Judge или verifier | высокая | проверять вывод более дешёвой модели по явной рубрике |
| Короткая поддержка и FAQ | низкая | выбрать меньшую модель и эскалировать в Ultra только трудные случаи |
| Массовое извлечение полей | низкая | использовать компактную модель или детерминированный парсер |
| Изображения, аудио и видео | отсутствует | Ultra принимает только текст; нужен мультимодальный checkpoint |
Хорошая схема для агентного продукта выглядит так: дешёвая модель классифицирует запрос и выполняет простые tool calls, Ultra строит трудный план или разбирает тупиковую ситуацию, а детерминированные проверки подтверждают результат. Такой роутинг снижает число дорогих длинных ответов и уменьшает задержку.
Что показывают тесты NVIDIA
| Бенчмарк | BF16 | NVFP4 | Сценарий |
|---|---|---|---|
| Terminal Bench 2.1 | 56,4 | 53,9 | агент решает задачи в терминале |
| SWE-Bench Verified | 70,7 | 69,5 | исправление дефектов в репозиториях |
| SWE-Bench Multilingual | 67,7 | 69,1 | многоязычные задачи разработки |
| TauBench V3, среднее | 70,9 | 70,3 | многошаговые диалоги и инструменты |
| ProfBench с поиском | 56,0 | 56,4 | профессиональное исследование с инструментами |
| GPQA без инструментов | 87,0 | 87,9 | сложные научные вопросы |
| IFBench | 81,7 | 82,3 | следование инструкциям |
| RULER на 1M | 94,7 | 94,0 | синтетическое извлечение из длинного контекста |
Это результаты релизного технического отчёта NVIDIA. Они зависят от prompt, reasoning budget, agent harness, набора инструментов, sandbox и параметров генерации. Например, ProfBench использует поиск и LLM-судью, а TauBench — симулятор пользователя и несколько прогонов. RULER проверяет контролируемое извлечение и не гарантирует такую же точность на миллионе токенов реального кода или договоров.
Квантизация NVFP4 в таблице близка к BF16, но отклонение зависит от задачи. Для собственного продукта нужно сравнивать checkpoints на одних и тех же данных, а не переносить среднее число из отчёта.
Русский язык и безопасность
Русский язык не входит в официальный список поддерживаемых языков Ultra. NVIDIA включала русский текст в multilingual Common Crawl при предобучении, поэтому модель способна отвечать по-русски. Это не подтверждает качество терминологии, фактов, склонений, tool arguments и защитных отказов.
Для русского продукта соберите минимум три группы тестов:
- обычные запросы пользователей с естественными ошибками и разговорными формами;
- профессиональные тексты вашей отрасли, где важны термины, числа и ссылки;
- опасные и неоднозначные запросы, включая prompt injection в найденном документе.
Ultra остаётся генеративной моделью и может ошибаться, галлюцинировать источники или выполнить неверный tool call. Для продакшена нужны модерация ввода и вывода, allowlist инструментов, изоляция секретов, sandbox для кода, ограничение числа шагов и подтверждение человеком для денег, публикаций, удаления данных и внешних сообщений. Отдельная Nemotron Content Safety может быть частью контура, но не заменяет правила доступа и проверку результата.
Где запускать: hosted или локально
| Способ | Старт | Масштабирование | Данные | Экономика | Когда выбирать |
|---|---|---|---|---|---|
| NVIDIA Build free | минуты | ограничено trial capacity | input/output записываются | $0 в пределах лимита | знакомство, prompt и интеграционный прототип |
OpenRouter :free |
минуты | 20 RPM и суточный cap | данные идут OpenRouter и NVIDIA | $0 на доступном free-route | запасной тестовый маршрут, сравнение клиентов |
| Partner serverless | часы | задаёт провайдер | по договору провайдера | оплата токенов | пилот и переменная нагрузка |
| Partner dedicated | часы или дни | выделенные GPU | зависит от VPC/region | GPU-minute/hour | стабильная нагрузка без своего кластера |
| Self-host, open runtime | дни или недели | отвечает ваша платформа | внутри выбранного периметра | GPU + эксплуатация | контроль данных, высокая постоянная загрузка, своя команда |
| Self-host NIM | дни или недели | оптимизированные профили и enterprise support | внутри периметра | GPU + NIM production license | компании, которым нужны поддерживаемые контейнеры и SLA |
NIM не обязателен. Веса можно обслуживать через vLLM, SGLang или TensorRT-LLM с учётом лицензий этих компонентов. NIM упаковывает оптимизированный runtime, зависимости, профили и стандартные API. Доступ для разработки и тестирования бесплатный; production NIM требует NVIDIA AI Enterprise.
Публичный прайс NVIDIA AI Enterprise, проверенный 6 сентября 2026 года, указывает $4500 за GPU в год для self-managed subscription. Для cloud marketplace production указано $1 за GPU-час плюс стоимость облачного инстанса. Лицензия считается на каждый GPU в сервере; у части H100, H200 NVL и A800 entitlement может входить в поставку. Цены и комплектация меняются, поэтому перед расчётом TCO нужна актуальная коммерческая проверка.
Партнёрские endpoint на дату проверки
В каталоге NVIDIA были доступны такие предложения. Цены приведены в долларах за миллион токенов и служат снимком на 6 сентября 2026 года.
| Провайдер | Вход | Выход | Формат |
|---|---|---|---|
| Lightning AI | $0,41 | $1,20 | serverless |
| DeepInfra | $0,50 | $2,20 | serverless; выделенный GPU от $0,01/мин на карточке |
| Bitdeer AI | $0,80 | $2,60 | serverless |
| GMI Cloud | $0,80 | $2,60 | serverless |
| DigitalOcean | $0,90 | $1,70 | serverless |
| OpenRouter | $0,63 | $3,13 | платный route; free-вариант учитывается отдельно |
| Together AI | — | — | dedicated GPU от $0,60/мин |
Сравнивать нужно не только цену. Уточняйте точный model ID, precision, context и output cap, регионы, кэш, rate limits, журналирование, использование данных для обучения, удаление логов, резервирование мощности и SLA. Одинаковое имя модели не гарантирует одинаковую квантизацию и поведение parser.
Сколько GPU нужно для локального запуска
Nemotron 3 Ultra относится к дата-центровому классу. Обычной игровой видеокарты недостаточно.
| Профиль | Минимум из Model Card | Хранилище модели | Практический смысл |
|---|---|---|---|
| NVFP4 | 4× GB200, 4× B200, 4× GB300, 4× B300 или 8× H100 | около 330 ГБ cache | минимальный поддерживаемый путь; Blackwell даёт нативный FP4 |
| BF16 | 8× GB200/B200/GB300/B300, 8× H200 или 16× H100 | около 1,1–1,7 ТБ cache | высокая точность и максимальный расход памяти |
NIM-контейнер добавляет примерно 38 ГБ. Для нескольких профилей и обновлений нужен дополнительный запас на диске.
Следующие оценки — расчёт, а не готовая конфигурация NVIDIA:
- 550 млрд BF16-параметров занимают около
550 млрд × 2 байта = 1,10 ТБтолько на веса; - 4-битный payload занимает теоретически около
550 млрд × 0,5 байта = 275 ГБ; - scales, metadata, runtime workspace, KV cache и Mamba state увеличивают расход;
- контекст 1M отнимает больше памяти и снижает число параллельных запросов.
Складывать объём VRAM нескольких потребительских карт недостаточно. Нужны поддерживаемые ядра, быстрый обмен между GPU, подходящие tensor/pipeline parallelism и, при нескольких узлах, высокоскоростная сеть. PCIe bottleneck способен превратить формально загруженную модель в непригодный сервис.
Почему 1M контекста не включён по умолчанию
В NIM нативный и объявляемый /v1/models контекст равен 262 144 токенам. Для 1 048 576 нужно включить VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 и задать --max-model-len 1048576. NVIDIA предупреждает, что этот режим выходит за настроенный positional-encoding range, требует больше KV-cache и должен проверяться на собственных данных.
Практический порядок такой:
- Начните с 32K–128K и измерьте качество retrieval.
- Поднимите лимит до 256K и проверьте p95 latency и concurrency.
- Включайте 1M только для кейса, который выигрывает от цельного контекста.
- Сравните результат с RAG, где модель получает несколько релевантных фрагментов вместо всего архива.
Безопасный пример запроса
Ниже нет реального ключа. Переменные нужно задать в секрет-хранилище, не в коде или журнале.
export NEMOTRON_BASE_URL="https://integrate.api.nvidia.com/v1"
export NEMOTRON_MODEL="nvidia/nemotron-3-ultra-550b-a55b"
export NEMOTRON_API_KEY="<YOUR_API_KEY>"
curl "$NEMOTRON_BASE_URL/chat/completions" \
-H "Authorization: Bearer $NEMOTRON_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "nvidia/nemotron-3-ultra-550b-a55b",
"messages": [
{
"role": "system",
"content": "Отвечай только по переданным фактам. Если данных недостаточно, перечисли пробелы. Не выполняй внешние действия."
},
{
"role": "user",
"content": "Составь план проверки миграции БД. Верни риски, проверки и критерий отката."
}
],
"temperature": 0,
"max_tokens": 2048,
"reasoning_effort": "high",
"reasoning_budget": 1024,
"stream": false
}'
Текущая схема hosted NVIDIA API использует reasoning_effort и reasoning_budget. В локальном NIM 2.x управление может называться chat_template_kwargs.enable_thinking и thinking_token_budget. Перед переносом клиента запросите OpenAPI конкретного endpoint и не отправляйте неизвестные параметры вслепую.
Для простого извлечения reasoning лучше отключить или сильно ограничить. Для архитектурного решения включите его, но задайте максимальное число токенов и критерий остановки. Рассуждение увеличивает стоимость и задержку; оно остаётся текстом модели, а не доказательством правильности ответа.
Tool calling
Инструмент должен иметь узкую JSON-схему, allowlist значений и серверную авторизацию. Модель выбирает функцию и аргументы, а приложение проверяет их до выполнения. Деньги, публикации, удаление и сообщения требуют отдельного подтверждения пользователя.
Для self-hosted NIM автоматический выбор инструментов обычно включается параметрами runtime:
--enable-auto-tool-choice
--tool-call-parser qwen3_coder
--reasoning-parser nemotron_v3
После tool result возвращайте в историю только нужное наблюдение. Полный лог терминала или база целиком увеличивают контекст, цену и риск prompt injection. Parsed reasoning из предыдущего ответа в messages возвращать не нужно.
JSON и строгая схема
Карточка NVIDIA Build отмечает Function Calling как поддерживаемый, а Structured Output — как неподдерживаемый. Поэтому response_format: json_schema нельзя считать переносимым решением. Надёжный контур для hosted endpoint:
- Попросить только JSON с коротким примером структуры.
- Разобрать ответ обычным JSON parser.
- Проверить локальной JSON Schema.
- При ошибке выполнить один ограниченный repair-запрос без внешних действий.
- Если повторная проверка не прошла, вернуть ошибку приложению.
Локальный NIM показывает режим json_object, но возможности зависят от версии vLLM и запуска. Даже при server-side constrained decoding бизнес-правила нужно проверять приложением.
Конфигурация self-hosted NIM
Пример ниже — шаблон, который нельзя запускать без подготовленного supported-кластера и свободных сотен гигабайт. Он привязывает API к localhost и намеренно оставляет tag placeholder, чтобы команда не скачала случайный latest.
export NGC_API_KEY="<YOUR_NGC_KEY>"
export LOCAL_NIM_CACHE="/absolute/path/to/nim-cache"
export NIM_TAG="<SIGNED_TESTED_TAG>"
docker run --gpus all \
-e NGC_API_KEY="$NGC_API_KEY" \
-e NIM_PASSTHROUGH_ARGS="--max-model-len 262144 --reasoning-parser nemotron_v3" \
-v "$LOCAL_NIM_CACHE:/opt/nim/.cache" \
-p 127.0.0.1:8000:8000 \
"nvcr.io/nim/nvidia/nemotron-3-ultra-550b-a55b:$NIM_TAG"
После запуска проверяйте готовность и фактический ID:
curl -fsS http://127.0.0.1:8000/v1/health/live
curl -fsS http://127.0.0.1:8000/v1/health/ready
curl -fsS http://127.0.0.1:8000/v1/models
curl -fsS http://127.0.0.1:8000/v1/metadata
Актуальный model-specific guide, профили и параметры собраны в инструкции NIM для Nemotron 3 Ultra. Не смешивайте tag контейнера, документацию другой версии и флаги свежего vLLM: parser и engine options меняются.
Из чего складывается стоимость
Для serverless API считайте не цену одного запроса, а стоимость успешно завершённой задачи:
стоимость задачи = input + output/reasoning + повторные tool rounds + retries + storage/egress.
Длинный агент каждый ход снова отправляет историю в stateless Chat Completions. Даже дешёвый вход дорожает, когда в контексте накапливаются планы, логи и результаты инструментов. Сокращайте наблюдения, храните состояние вне prompt и кэшируйте стабильный префикс, если endpoint это поддерживает.
Для собственного кластера формула другая:
TCO = GPU-часы + NIM-лицензия при её использовании + электричество + сеть + хранилище + эксплуатация.
Основные факторы:
- число и класс GPU;
- BF16 или NVFP4;
- средняя загрузка и простой;
- batch size, concurrency и требуемая latency;
- длина контекста и KV cache;
- MTP/speculative decoding;
- несколько копий checkpoint для обновлений и отката;
- high-speed interconnect и multi-node сеть;
- мониторинг, безопасность и дежурство инженеров.
При редкой или непредсказуемой нагрузке serverless обычно проще. При постоянной высокой загрузке, жёстком data residency и готовой инфраструктурной команде стоит моделировать self-host. Решение принимают после нагрузочного теста, потому что стоимость GPU-часа без throughput не показывает цену полезного ответа.
Чем заменить Ultra
| Сценарий | Альтернатива | Почему |
|---|---|---|
| Большинство agent/RAG задач | Nemotron 3 Super 120B-A12B | меньше модель, до 1M контекста, reasoning и tools |
| Массовые tool calls и классификация | Nemotron 3.5 Lightning 30B-A3B | 3B активных параметров, ориентирована на execution layer |
| Изображения, видео, аудио, OCR, GUI | Nemotron 3 Nano Omni 30B-A3B | мультимодальный вход; у текущей карточки указан английский язык |
| Русскоязычный продукт | модель с официальной поддержкой русского, выбранная по собственному тесту | Ultra не заявляет русский как поддерживаемый |
| Жёсткая JSON Schema в managed API | endpoint, который явно заявляет constrained structured output | NVIDIA hosted Ultra пока этого не обещает |
| Небольшой локальный сервер | компактная 7B–30B модель | Ultra требует дата-центрового multi-GPU |
Nemotron 3 Super разумно протестировать первой: Ultra имеет смысл только при измеримом приросте качества на трудных запросах. Для агентной системы полезен router: Lightning выполняет частые действия, Super решает средние задачи, Ultra подключается к сложным планам и восстановлению после ошибок.
Как проверить модель перед внедрением
Соберите 30–100 реальных задач на каждый сценарий. Для каждого прогона сохраняйте model ID, провайдера, precision, runtime, prompt version, reasoning budget и parser flags.
| Проверка | Метрика | Критерий |
|---|---|---|
| Ответ по документу | доля утверждений с подтверждённым фрагментом | заданный порог и ноль выдуманных источников |
| Код | unit/integration tests, отсутствие неожиданных файловых изменений | все обязательные тесты проходят в sandbox |
| Tool calling | правильный выбор функции и валидность аргументов | schema pass rate и доля верных вызовов |
| JSON | parse rate и JSON Schema pass rate | приемлемо без ручной коррекции |
| Русский | факты, терминология, грамматика, safety | оценка носителями и отраслевыми экспертами |
| Длинный контекст | accuracy на 32K, 128K, 256K и 1M | качество не падает ниже порога |
| Производительность | time to first token, tokens/s, p50/p95 latency | SLA при целевой concurrency |
| Надёжность | 4xx/5xx, timeouts, retry rate | ограниченные retries без дублирования действий |
| Экономика | стоимость успешной задачи | сравнение Ultra, Super и меньшей модели |
В тестовый набор добавьте повреждённый tool result, prompt injection внутри RAG-документа, недостаточные данные, противоречащие источники, слишком длинный контекст, 429 и недоступность провайдера. Успешный красивый ответ на нескольких демонстрационных prompt не заменяет такой прогон.
Частые проблемы
| Симптом | Вероятная причина | Что делать |
|---|---|---|
401 или 403 |
неверный base URL, ключ или scope | проверить секрет-хранилище и endpoint, не печатать ключ в лог |
Model not deployed / 404 |
catalog listing не равен доступу аккаунта | запросить список моделей, выбрать доступную Ultra или fallback |
429 |
исчерпан free limit или перегружен апстрим | учитывать Retry-After, exponential backoff с jitter, ограничить retries |
| Tool call пришёл обычным текстом | parser не включён или клиент ждёт другой формат | проверить qwen3_coder, runtime version и schema tools |
| Рассуждение смешано с ответом | отсутствует Nemotron reasoning parser | включить nemotron_v3, разбирать отдельное поле |
| Невалидный JSON | endpoint не поддерживает строгий structured output | локальная schema validation и один repair retry |
| Out of memory | длинный context, высокая concurrency или неверный профиль | уменьшить max-model-len, batch и число sequences, проверить topology |
| NIM долго «ничего не делает» | первый запуск загружает сотни гигабайт | проверить диск, cache и информационный log level; не запускать дубликаты |
| Качество упало после few-shot | prompt/prefill взаимодействует с runtime или шаблоном | сравнить 0/4/8/20-shot на фиксированном наборе и закрепить версию |
В июне 2026 года в NVIDIA/NemoClaw фиксировался случай, когда Ultra была в каталоге, но временно не была развёрнута для аккаунта. В SGLang также описан сильный спад GSM8K при 20-shot, отсутствовавший при 8-shot. Эти отчёты не доказывают постоянный дефект модели, но показывают, зачем проверять доступность и длину prompt в CI.
Вывод
Nemotron 3 Ultra 550B-A55B — открытая reasoning-модель дата-центрового класса для сложных агентных задач. Её можно коммерчески использовать по OpenMDW-1.1, бесплатно попробовать через NVIDIA Build или текущий OpenRouter free-route. Эти варианты годятся для оценки, но не обещают постоянную нулевую стоимость, выделенную мощность или конфиденциальность.
Начните с обезличенного тестового набора и сравните Ultra с Nemotron 3 Super. Если Ultra даёт измеримый прирост качества, выберите платный endpoint для переменной нагрузки или self-host для стабильной нагрузки и контроля данных. Для локального запуска планируйте минимум несколько дата-центровых GPU, сотни гигабайт хранилища и отдельную проверку русского языка, structured output, tool calling и длинного контекста.
Автор статьи

Редактор и автор статей
Пишет экспертные материалы о цифровом маркетинге и автоматизации. Журналист с опытом в деловых медиа, отвечает за качество и достоверность публикаций.
Вопросы и ответы
Бесплатны веса и лицензия OpenMDW-1.1, а также ограниченные trial/free endpoints. GPU, электричество, хранение, платные API и production NIM оплачиваются.
Да, OpenMDW-1.1 разрешает коммерческое использование Model Materials. При распространении материалов модели нужно сохранить лицензию и применимые notices. Отдельно соблюдаются законы, права третьих лиц и условия выбранного хоста.
Нет. Актуальная версия — Nemotron 3 Ultra 550B-A55B от 4 июня 2026 года. Модель 253B относится к предыдущей Llama 3.1-линии и имеет другой API ID.
Один такой GPU не подходит. Теоретическое 4-битное тело весов занимает около 275 ГБ до runtime overhead. Официальный минимум NVFP4 начинается с четырёх B200/GB200/B300/GB300 либо восьми H100.
Русский присутствовал в части pre-training data, но не включён NVIDIA в официальный список поддерживаемых языков Ultra. Для русского интерфейса нужен отдельный набор тестов и fallback-модель.
В NIM по умолчанию включено 262 144 токена. Режим 1 048 576 включается отдельно, требует больше памяти, снижает concurrency и нуждается в проверке качества на реальных данных.
Нет. Открытые веса можно обслуживать через vLLM, SGLang или TensorRT-LLM. NIM удобен готовыми профилями, стандартными API и enterprise support; для production у него отдельная лицензия.
Конкретное предупреждение на странице Ultra говорит, что input/output записываются и могут использоваться для улучшения продуктов и сервисов NVIDIA, включая AI-модели. Конфиденциальные и персональные данные туда отправлять нельзя. У контрактного или self-hosted решения политика может быть другой.
Hosted NVIDIA Build endpoint сейчас не заявляет Structured Output для Ultra. Просите JSON, затем разбирайте и проверяйте его локальной JSON Schema. В self-hosted NIM JSON mode зависит от runtime и конфигурации.
Для первого практического self-hosted теста обычно выбирают NVFP4 из-за меньшего объёма. BF16 требует примерно 1,1 ТБ только на веса. Решение закрепляют после сравнения качества и производительности на собственном наборе задач.
Смотрите также

Где дешевле DeepSeek V4 Flash и V4 Pro — API, подписки и альтернативы
26 сентября 2026 г.

OpenCode Go: лимиты DeepSeek V4 Flash и Pro
26 сентября 2026 г.

GPT-5.3-Codex-Spark: что это за модель, где использовать и какие есть аналоги
26 сентября 2026 г.

Что такое Cursor CLI: как использовать и сравнение с конкурентами
25 сентября 2026 г.
Комментарии(0)
Оставьте комментарий
Войдите, чтобы присоединиться к обсуждению