Бесплатная модель Nemotron Ultra от NVIDIA: где и как применить
Нейросети / ИИ

Бесплатная модель Nemotron Ultra от NVIDIA: где и как применить

На 6 сентября 2026 года под Nemotron Ultra нужно понимать NVIDIA-Nemotron-3-Ultra-550B-A55B — текстовую reasoning-модель NVIDIA с 550 млрд параметров, из которых до 55 млрд активируются для каждого токена.

Елена Кравцова
Елена Кравцова
Редактор и автор статей17 мин

На 6 сентября 2026 года под Nemotron Ultra нужно понимать NVIDIA-Nemotron-3-Ultra-550B-A55B — текстовую reasoning-модель NVIDIA с 550 млрд параметров, из которых до 55 млрд активируются для каждого токена. Бесплатны её веса и права на использование по OpenMDW-1.1, а также ограниченный API для прототипов. Вычисления в продакшене бесплатными не становятся: после теста придётся платить провайдеру за токены, арендовать GPU или содержать собственный кластер. Ultra стоит выбирать для сложного планирования, кода, исследований, длинных документов и агентных сценариев; для обычного чата и массовых простых запросов она избыточна.

Какая модель сейчас называется Nemotron Ultra

Актуальная версия вышла 4 июня 2026 года. Её полное имя — NVIDIA-Nemotron-3-Ultra-550B-A55B. В старых инструкциях и каталогах всё ещё встречается Llama-3.1-Nemotron-Ultra-253B-v1, выпущенная в 2025 году. Это другая модель с иным размером, архитектурой и API-идентификатором.

Характеристика Nemotron 3 Ultra 550B-A55B
Разработчик NVIDIA
Дата релиза 4 июня 2026 года
Параметры 550 млрд всего, до 55 млрд активных на токен
Архитектура гибрид Mamba-2 и Attention, Latent Mixture-of-Experts, Multi-Token Prediction
Модальности текст на входе, текст на выходе
Контекст 262 144 токена по умолчанию в NIM; до 1 048 576 в расширенном режиме
Максимальный ответ в NVIDIA hosted API 32 768 токенов; значение по умолчанию — 16 384
Reasoning включается и выключается, бюджет рассуждения можно ограничивать
Инструменты function calling поддерживается
Структурированный вывод на текущем NVIDIA Build endpoint помечен как неподдерживаемый; локальный NIM умеет JSON mode при подходящей конфигурации
Лицензия весов OpenMDW-1.1, коммерческое и некоммерческое применение
Официально перечисленные языки английский, французский, испанский, итальянский, немецкий, японский, корейский, хинди, бразильский португальский, китайский

Число A55B описывает вычислительную нагрузку одного шага, но не объём модели в памяти. Архитектура Mixture-of-Experts выбирает часть экспертов для текущего токена, однако все 550 млрд параметров нужно хранить на GPU, в оперативной памяти при offload или в распределённом хранилище. Поэтому Ultra нельзя оценивать как обычную модель на 55 млрд параметров.

В каталоге NVIDIA рядом с именем встречается значение 561B, тогда как Model Card, технический отчёт и имя checkpoint указывают 550B. NVIDIA не объясняет расхождение. Для планирования стоит использовать официальный класс 550B и проверять фактический профиль NIM перед закупкой оборудования.

Какой checkpoint нужен

Вариант Для чего предназначен Практическое замечание
...-NVFP4 готовый chat/reasoning, уменьшенный memory footprint основной вариант для Blackwell; на Hopper используется совместимый путь без всех преимуществ нативного FP4
...-BF16 готовый post-trained chat/reasoning максимальная точность без 4-битного сжатия, но очень высокий расход памяти
...-Base-BF16 продолжение предобучения и собственный post-training как готовый ассистент не подходит
...-GenRM reward model для обучения с подкреплением не заменяет генеративную Ultra

Что здесь действительно бесплатно

У слова «бесплатная» четыре разных значения. Их полезно разделить до выбора архитектуры.

Вариант Что можно получить без оплаты Главные ограничения
Веса OpenMDW-1.1 скачать, запускать, изменять и применять коммерчески нужны сотни гигабайт хранилища и дорогие GPU; при распространении сохраняются лицензия и notices
NVIDIA Build прототипный endpoint без оплаты за токены до 40 запросов в минуту для большинства моделей, персональный лимит и доступность; данные trial записываются
OpenRouter :free бесплатный маршрут к Ultra на дату проверки 20 запросов в минуту и суточный лимит, общая мощность, маршрут может исчезнуть
NIM для разработки контейнер и оптимизированный serving для dev/test продакшен требует NVIDIA AI Enterprise либо облачную production-лицензию

OpenMDW-1.1 даёт широкие права на Model Materials без лицензионной платы. Разрешены использование, изменение и распространение. Если вы передаёте сами веса или другие части Model Materials, нужно приложить текст лицензии и сохранить применимые уведомления об авторстве и происхождении. Для сгенерированного результата дополнительных условий в лицензии нет. Лицензия предоставляется без гарантий, а проверять права третьих лиц и законность конкретного применения должен оператор. Полный текст лучше сверить перед релизом продукта в OpenMDW-1.1. Разобраться в различиях лицензии и открытых весов помогает статья о разнице между открытыми весами и закрытыми ИИ.

Модельная лицензия не оплачивает инфраструктуру. Даже если использовать открытый vLLM или SGLang вместо NIM, останутся расходы на GPU, электричество, накопители, сеть, инженеров и мониторинг.

Бесплатный API NVIDIA

Build.NVIDIA.com разрешает тестировать модели бесплатно и сообщает лимит до 40 RPM — запросов в минуту — для большинства моделей. Точный персональный предел показывается в аккаунте. Это среда прототипирования без обещания бессрочной доступности, выделенной мощности или производственного соглашения об уровне сервиса.

Для Ultra действует важное предупреждение о данных: NVIDIA записывает вход и выход для предоставления trial, контроля безопасности и улучшения продуктов и сервисов, включая AI-модели. В бесплатный endpoint нельзя отправлять пароли, приватные репозитории, договоры, клиентские базы, медицинские сведения и персональные данные. Фиксированный срок хранения для этой модели в публичной карточке не указан.

Бесплатный маршрут OpenRouter

На дату проверки доступен ID nvidia/nemotron-3-ultra-550b-a55b:free. Общие ограничения OpenRouter для моделей с суффиксом :free такие:

  • 20 запросов в минуту;
  • 50 запросов в сутки, если за всё время куплено менее $10 credits;
  • 1000 запросов в сутки после покупки не менее $10 credits.

Покупка credits повышает суточный лимит, хотя сами запросы к free-route остаются бесплатными. На маршруте действует предупреждение NVIDIA о записи данных. Мощность делится между пользователями, поэтому возможны очереди, ошибки апстрима и временное отсутствие модели.

Для каких задач подходит Ultra

Nemotron 3 Ultra создавалась как верхний уровень агентной системы. Её выгоднее вызывать в редких сложных точках, а рутинные операции отдавать меньшей модели.

Задача Пригодность Как применять
Планирование сложного проекта высокая построить план, выявить зависимости, проверить ограничения, затем передать этапы исполнителям
Работа с большим репозиторием высокая анализ архитектуры, поиск причины дефекта, план патча; выполнение кода — только в sandbox с тестами
Deep research высокая синтез нескольких источников, противоречия, вопросы для проверки; факты подтверждать ссылками
Длинные документы и RAG высокая анализировать отобранные фрагменты, цитировать источник, проверять ответы retrieval-слоем
Математика и наука высокая включить ограниченный reasoning budget, затем проверить вычисления отдельным инструментом
Judge или verifier высокая проверять вывод более дешёвой модели по явной рубрике
Короткая поддержка и FAQ низкая выбрать меньшую модель и эскалировать в Ultra только трудные случаи
Массовое извлечение полей низкая использовать компактную модель или детерминированный парсер
Изображения, аудио и видео отсутствует Ultra принимает только текст; нужен мультимодальный checkpoint

Хорошая схема для агентного продукта выглядит так: дешёвая модель классифицирует запрос и выполняет простые tool calls, Ultra строит трудный план или разбирает тупиковую ситуацию, а детерминированные проверки подтверждают результат. Такой роутинг снижает число дорогих длинных ответов и уменьшает задержку.

Что показывают тесты NVIDIA

Бенчмарк BF16 NVFP4 Сценарий
Terminal Bench 2.1 56,4 53,9 агент решает задачи в терминале
SWE-Bench Verified 70,7 69,5 исправление дефектов в репозиториях
SWE-Bench Multilingual 67,7 69,1 многоязычные задачи разработки
TauBench V3, среднее 70,9 70,3 многошаговые диалоги и инструменты
ProfBench с поиском 56,0 56,4 профессиональное исследование с инструментами
GPQA без инструментов 87,0 87,9 сложные научные вопросы
IFBench 81,7 82,3 следование инструкциям
RULER на 1M 94,7 94,0 синтетическое извлечение из длинного контекста

Это результаты релизного технического отчёта NVIDIA. Они зависят от prompt, reasoning budget, agent harness, набора инструментов, sandbox и параметров генерации. Например, ProfBench использует поиск и LLM-судью, а TauBench — симулятор пользователя и несколько прогонов. RULER проверяет контролируемое извлечение и не гарантирует такую же точность на миллионе токенов реального кода или договоров.

Квантизация NVFP4 в таблице близка к BF16, но отклонение зависит от задачи. Для собственного продукта нужно сравнивать checkpoints на одних и тех же данных, а не переносить среднее число из отчёта.

Русский язык и безопасность

Русский язык не входит в официальный список поддерживаемых языков Ultra. NVIDIA включала русский текст в multilingual Common Crawl при предобучении, поэтому модель способна отвечать по-русски. Это не подтверждает качество терминологии, фактов, склонений, tool arguments и защитных отказов.

Для русского продукта соберите минимум три группы тестов:

  • обычные запросы пользователей с естественными ошибками и разговорными формами;
  • профессиональные тексты вашей отрасли, где важны термины, числа и ссылки;
  • опасные и неоднозначные запросы, включая prompt injection в найденном документе.

Ultra остаётся генеративной моделью и может ошибаться, галлюцинировать источники или выполнить неверный tool call. Для продакшена нужны модерация ввода и вывода, allowlist инструментов, изоляция секретов, sandbox для кода, ограничение числа шагов и подтверждение человеком для денег, публикаций, удаления данных и внешних сообщений. Отдельная Nemotron Content Safety может быть частью контура, но не заменяет правила доступа и проверку результата.

Где запускать: hosted или локально

Способ Старт Масштабирование Данные Экономика Когда выбирать
NVIDIA Build free минуты ограничено trial capacity input/output записываются $0 в пределах лимита знакомство, prompt и интеграционный прототип
OpenRouter :free минуты 20 RPM и суточный cap данные идут OpenRouter и NVIDIA $0 на доступном free-route запасной тестовый маршрут, сравнение клиентов
Partner serverless часы задаёт провайдер по договору провайдера оплата токенов пилот и переменная нагрузка
Partner dedicated часы или дни выделенные GPU зависит от VPC/region GPU-minute/hour стабильная нагрузка без своего кластера
Self-host, open runtime дни или недели отвечает ваша платформа внутри выбранного периметра GPU + эксплуатация контроль данных, высокая постоянная загрузка, своя команда
Self-host NIM дни или недели оптимизированные профили и enterprise support внутри периметра GPU + NIM production license компании, которым нужны поддерживаемые контейнеры и SLA

NIM не обязателен. Веса можно обслуживать через vLLM, SGLang или TensorRT-LLM с учётом лицензий этих компонентов. NIM упаковывает оптимизированный runtime, зависимости, профили и стандартные API. Доступ для разработки и тестирования бесплатный; production NIM требует NVIDIA AI Enterprise.

Публичный прайс NVIDIA AI Enterprise, проверенный 6 сентября 2026 года, указывает $4500 за GPU в год для self-managed subscription. Для cloud marketplace production указано $1 за GPU-час плюс стоимость облачного инстанса. Лицензия считается на каждый GPU в сервере; у части H100, H200 NVL и A800 entitlement может входить в поставку. Цены и комплектация меняются, поэтому перед расчётом TCO нужна актуальная коммерческая проверка.

Партнёрские endpoint на дату проверки

В каталоге NVIDIA были доступны такие предложения. Цены приведены в долларах за миллион токенов и служат снимком на 6 сентября 2026 года.

Провайдер Вход Выход Формат
Lightning AI $0,41 $1,20 serverless
DeepInfra $0,50 $2,20 serverless; выделенный GPU от $0,01/мин на карточке
Bitdeer AI $0,80 $2,60 serverless
GMI Cloud $0,80 $2,60 serverless
DigitalOcean $0,90 $1,70 serverless
OpenRouter $0,63 $3,13 платный route; free-вариант учитывается отдельно
Together AI — — dedicated GPU от $0,60/мин

Сравнивать нужно не только цену. Уточняйте точный model ID, precision, context и output cap, регионы, кэш, rate limits, журналирование, использование данных для обучения, удаление логов, резервирование мощности и SLA. Одинаковое имя модели не гарантирует одинаковую квантизацию и поведение parser.

Сколько GPU нужно для локального запуска

Nemotron 3 Ultra относится к дата-центровому классу. Обычной игровой видеокарты недостаточно.

Профиль Минимум из Model Card Хранилище модели Практический смысл
NVFP4 4× GB200, 4× B200, 4× GB300, 4× B300 или 8× H100 около 330 ГБ cache минимальный поддерживаемый путь; Blackwell даёт нативный FP4
BF16 8× GB200/B200/GB300/B300, 8× H200 или 16× H100 около 1,1–1,7 ТБ cache высокая точность и максимальный расход памяти

NIM-контейнер добавляет примерно 38 ГБ. Для нескольких профилей и обновлений нужен дополнительный запас на диске.

Следующие оценки — расчёт, а не готовая конфигурация NVIDIA:

  • 550 млрд BF16-параметров занимают около 550 млрд × 2 байта = 1,10 ТБ только на веса;
  • 4-битный payload занимает теоретически около 550 млрд × 0,5 байта = 275 ГБ;
  • scales, metadata, runtime workspace, KV cache и Mamba state увеличивают расход;
  • контекст 1M отнимает больше памяти и снижает число параллельных запросов.

Складывать объём VRAM нескольких потребительских карт недостаточно. Нужны поддерживаемые ядра, быстрый обмен между GPU, подходящие tensor/pipeline parallelism и, при нескольких узлах, высокоскоростная сеть. PCIe bottleneck способен превратить формально загруженную модель в непригодный сервис.

Почему 1M контекста не включён по умолчанию

В NIM нативный и объявляемый /v1/models контекст равен 262 144 токенам. Для 1 048 576 нужно включить VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 и задать --max-model-len 1048576. NVIDIA предупреждает, что этот режим выходит за настроенный positional-encoding range, требует больше KV-cache и должен проверяться на собственных данных.

Практический порядок такой:

  1. Начните с 32K–128K и измерьте качество retrieval.
  2. Поднимите лимит до 256K и проверьте p95 latency и concurrency.
  3. Включайте 1M только для кейса, который выигрывает от цельного контекста.
  4. Сравните результат с RAG, где модель получает несколько релевантных фрагментов вместо всего архива.

Безопасный пример запроса

Ниже нет реального ключа. Переменные нужно задать в секрет-хранилище, не в коде или журнале.

export NEMOTRON_BASE_URL="https://integrate.api.nvidia.com/v1"
export NEMOTRON_MODEL="nvidia/nemotron-3-ultra-550b-a55b"
export NEMOTRON_API_KEY="<YOUR_API_KEY>"

curl "$NEMOTRON_BASE_URL/chat/completions" \
  -H "Authorization: Bearer $NEMOTRON_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "nvidia/nemotron-3-ultra-550b-a55b",
    "messages": [
      {
        "role": "system",
        "content": "Отвечай только по переданным фактам. Если данных недостаточно, перечисли пробелы. Не выполняй внешние действия."
      },
      {
        "role": "user",
        "content": "Составь план проверки миграции БД. Верни риски, проверки и критерий отката."
      }
    ],
    "temperature": 0,
    "max_tokens": 2048,
    "reasoning_effort": "high",
    "reasoning_budget": 1024,
    "stream": false
  }'

Текущая схема hosted NVIDIA API использует reasoning_effort и reasoning_budget. В локальном NIM 2.x управление может называться chat_template_kwargs.enable_thinking и thinking_token_budget. Перед переносом клиента запросите OpenAPI конкретного endpoint и не отправляйте неизвестные параметры вслепую.

Для простого извлечения reasoning лучше отключить или сильно ограничить. Для архитектурного решения включите его, но задайте максимальное число токенов и критерий остановки. Рассуждение увеличивает стоимость и задержку; оно остаётся текстом модели, а не доказательством правильности ответа.

Tool calling

Инструмент должен иметь узкую JSON-схему, allowlist значений и серверную авторизацию. Модель выбирает функцию и аргументы, а приложение проверяет их до выполнения. Деньги, публикации, удаление и сообщения требуют отдельного подтверждения пользователя.

Для self-hosted NIM автоматический выбор инструментов обычно включается параметрами runtime:

--enable-auto-tool-choice
--tool-call-parser qwen3_coder
--reasoning-parser nemotron_v3

После tool result возвращайте в историю только нужное наблюдение. Полный лог терминала или база целиком увеличивают контекст, цену и риск prompt injection. Parsed reasoning из предыдущего ответа в messages возвращать не нужно.

JSON и строгая схема

Карточка NVIDIA Build отмечает Function Calling как поддерживаемый, а Structured Output — как неподдерживаемый. Поэтому response_format: json_schema нельзя считать переносимым решением. Надёжный контур для hosted endpoint:

  1. Попросить только JSON с коротким примером структуры.
  2. Разобрать ответ обычным JSON parser.
  3. Проверить локальной JSON Schema.
  4. При ошибке выполнить один ограниченный repair-запрос без внешних действий.
  5. Если повторная проверка не прошла, вернуть ошибку приложению.

Локальный NIM показывает режим json_object, но возможности зависят от версии vLLM и запуска. Даже при server-side constrained decoding бизнес-правила нужно проверять приложением.

Конфигурация self-hosted NIM

Пример ниже — шаблон, который нельзя запускать без подготовленного supported-кластера и свободных сотен гигабайт. Он привязывает API к localhost и намеренно оставляет tag placeholder, чтобы команда не скачала случайный latest.

export NGC_API_KEY="<YOUR_NGC_KEY>"
export LOCAL_NIM_CACHE="/absolute/path/to/nim-cache"
export NIM_TAG="<SIGNED_TESTED_TAG>"

docker run --gpus all \
  -e NGC_API_KEY="$NGC_API_KEY" \
  -e NIM_PASSTHROUGH_ARGS="--max-model-len 262144 --reasoning-parser nemotron_v3" \
  -v "$LOCAL_NIM_CACHE:/opt/nim/.cache" \
  -p 127.0.0.1:8000:8000 \
  "nvcr.io/nim/nvidia/nemotron-3-ultra-550b-a55b:$NIM_TAG"

После запуска проверяйте готовность и фактический ID:

curl -fsS http://127.0.0.1:8000/v1/health/live
curl -fsS http://127.0.0.1:8000/v1/health/ready
curl -fsS http://127.0.0.1:8000/v1/models
curl -fsS http://127.0.0.1:8000/v1/metadata

Актуальный model-specific guide, профили и параметры собраны в инструкции NIM для Nemotron 3 Ultra. Не смешивайте tag контейнера, документацию другой версии и флаги свежего vLLM: parser и engine options меняются.

Из чего складывается стоимость

Для serverless API считайте не цену одного запроса, а стоимость успешно завершённой задачи:

стоимость задачи = input + output/reasoning + повторные tool rounds + retries + storage/egress.

Длинный агент каждый ход снова отправляет историю в stateless Chat Completions. Даже дешёвый вход дорожает, когда в контексте накапливаются планы, логи и результаты инструментов. Сокращайте наблюдения, храните состояние вне prompt и кэшируйте стабильный префикс, если endpoint это поддерживает.

Для собственного кластера формула другая:

TCO = GPU-часы + NIM-лицензия при её использовании + электричество + сеть + хранилище + эксплуатация.

Основные факторы:

  • число и класс GPU;
  • BF16 или NVFP4;
  • средняя загрузка и простой;
  • batch size, concurrency и требуемая latency;
  • длина контекста и KV cache;
  • MTP/speculative decoding;
  • несколько копий checkpoint для обновлений и отката;
  • high-speed interconnect и multi-node сеть;
  • мониторинг, безопасность и дежурство инженеров.

При редкой или непредсказуемой нагрузке serverless обычно проще. При постоянной высокой загрузке, жёстком data residency и готовой инфраструктурной команде стоит моделировать self-host. Решение принимают после нагрузочного теста, потому что стоимость GPU-часа без throughput не показывает цену полезного ответа.

Чем заменить Ultra

Сценарий Альтернатива Почему
Большинство agent/RAG задач Nemotron 3 Super 120B-A12B меньше модель, до 1M контекста, reasoning и tools
Массовые tool calls и классификация Nemotron 3.5 Lightning 30B-A3B 3B активных параметров, ориентирована на execution layer
Изображения, видео, аудио, OCR, GUI Nemotron 3 Nano Omni 30B-A3B мультимодальный вход; у текущей карточки указан английский язык
Русскоязычный продукт модель с официальной поддержкой русского, выбранная по собственному тесту Ultra не заявляет русский как поддерживаемый
Жёсткая JSON Schema в managed API endpoint, который явно заявляет constrained structured output NVIDIA hosted Ultra пока этого не обещает
Небольшой локальный сервер компактная 7B–30B модель Ultra требует дата-центрового multi-GPU

Nemotron 3 Super разумно протестировать первой: Ultra имеет смысл только при измеримом приросте качества на трудных запросах. Для агентной системы полезен router: Lightning выполняет частые действия, Super решает средние задачи, Ultra подключается к сложным планам и восстановлению после ошибок.

Как проверить модель перед внедрением

Соберите 30–100 реальных задач на каждый сценарий. Для каждого прогона сохраняйте model ID, провайдера, precision, runtime, prompt version, reasoning budget и parser flags.

Проверка Метрика Критерий
Ответ по документу доля утверждений с подтверждённым фрагментом заданный порог и ноль выдуманных источников
Код unit/integration tests, отсутствие неожиданных файловых изменений все обязательные тесты проходят в sandbox
Tool calling правильный выбор функции и валидность аргументов schema pass rate и доля верных вызовов
JSON parse rate и JSON Schema pass rate приемлемо без ручной коррекции
Русский факты, терминология, грамматика, safety оценка носителями и отраслевыми экспертами
Длинный контекст accuracy на 32K, 128K, 256K и 1M качество не падает ниже порога
Производительность time to first token, tokens/s, p50/p95 latency SLA при целевой concurrency
Надёжность 4xx/5xx, timeouts, retry rate ограниченные retries без дублирования действий
Экономика стоимость успешной задачи сравнение Ultra, Super и меньшей модели

В тестовый набор добавьте повреждённый tool result, prompt injection внутри RAG-документа, недостаточные данные, противоречащие источники, слишком длинный контекст, 429 и недоступность провайдера. Успешный красивый ответ на нескольких демонстрационных prompt не заменяет такой прогон.

Частые проблемы

Симптом Вероятная причина Что делать
401 или 403 неверный base URL, ключ или scope проверить секрет-хранилище и endpoint, не печатать ключ в лог
Model not deployed / 404 catalog listing не равен доступу аккаунта запросить список моделей, выбрать доступную Ultra или fallback
429 исчерпан free limit или перегружен апстрим учитывать Retry-After, exponential backoff с jitter, ограничить retries
Tool call пришёл обычным текстом parser не включён или клиент ждёт другой формат проверить qwen3_coder, runtime version и schema tools
Рассуждение смешано с ответом отсутствует Nemotron reasoning parser включить nemotron_v3, разбирать отдельное поле
Невалидный JSON endpoint не поддерживает строгий structured output локальная schema validation и один repair retry
Out of memory длинный context, высокая concurrency или неверный профиль уменьшить max-model-len, batch и число sequences, проверить topology
NIM долго «ничего не делает» первый запуск загружает сотни гигабайт проверить диск, cache и информационный log level; не запускать дубликаты
Качество упало после few-shot prompt/prefill взаимодействует с runtime или шаблоном сравнить 0/4/8/20-shot на фиксированном наборе и закрепить версию

В июне 2026 года в NVIDIA/NemoClaw фиксировался случай, когда Ultra была в каталоге, но временно не была развёрнута для аккаунта. В SGLang также описан сильный спад GSM8K при 20-shot, отсутствовавший при 8-shot. Эти отчёты не доказывают постоянный дефект модели, но показывают, зачем проверять доступность и длину prompt в CI.

Вывод

Nemotron 3 Ultra 550B-A55B — открытая reasoning-модель дата-центрового класса для сложных агентных задач. Её можно коммерчески использовать по OpenMDW-1.1, бесплатно попробовать через NVIDIA Build или текущий OpenRouter free-route. Эти варианты годятся для оценки, но не обещают постоянную нулевую стоимость, выделенную мощность или конфиденциальность.

Начните с обезличенного тестового набора и сравните Ultra с Nemotron 3 Super. Если Ultra даёт измеримый прирост качества, выберите платный endpoint для переменной нагрузки или self-host для стабильной нагрузки и контроля данных. Для локального запуска планируйте минимум несколько дата-центровых GPU, сотни гигабайт хранилища и отдельную проверку русского языка, structured output, tool calling и длинного контекста.

Автор статьи

Елена Кравцова — Редактор и автор статей
Елена Кравцова

Редактор и автор статей

Пишет экспертные материалы о цифровом маркетинге и автоматизации. Журналист с опытом в деловых медиа, отвечает за качество и достоверность публикаций.

Вопросы и ответы

Бесплатны веса и лицензия OpenMDW-1.1, а также ограниченные trial/free endpoints. GPU, электричество, хранение, платные API и production NIM оплачиваются.

Да, OpenMDW-1.1 разрешает коммерческое использование Model Materials. При распространении материалов модели нужно сохранить лицензию и применимые notices. Отдельно соблюдаются законы, права третьих лиц и условия выбранного хоста.

Нет. Актуальная версия — Nemotron 3 Ultra 550B-A55B от 4 июня 2026 года. Модель 253B относится к предыдущей Llama 3.1-линии и имеет другой API ID.

Один такой GPU не подходит. Теоретическое 4-битное тело весов занимает около 275 ГБ до runtime overhead. Официальный минимум NVFP4 начинается с четырёх B200/GB200/B300/GB300 либо восьми H100.

Русский присутствовал в части pre-training data, но не включён NVIDIA в официальный список поддерживаемых языков Ultra. Для русского интерфейса нужен отдельный набор тестов и fallback-модель.

В NIM по умолчанию включено 262 144 токена. Режим 1 048 576 включается отдельно, требует больше памяти, снижает concurrency и нуждается в проверке качества на реальных данных.

Нет. Открытые веса можно обслуживать через vLLM, SGLang или TensorRT-LLM. NIM удобен готовыми профилями, стандартными API и enterprise support; для production у него отдельная лицензия.

Конкретное предупреждение на странице Ultra говорит, что input/output записываются и могут использоваться для улучшения продуктов и сервисов NVIDIA, включая AI-модели. Конфиденциальные и персональные данные туда отправлять нельзя. У контрактного или self-hosted решения политика может быть другой.

Hosted NVIDIA Build endpoint сейчас не заявляет Structured Output для Ultra. Просите JSON, затем разбирайте и проверяйте его локальной JSON Schema. В self-hosted NIM JSON mode зависит от runtime и конфигурации.

Для первого практического self-hosted теста обычно выбирают NVFP4 из-за меньшего объёма. BF16 требует примерно 1,1 ТБ только на веса. Решение закрепляют после сравнения качества и производительности на собственном наборе задач.

Смотрите также

Поделиться

Комментарии(0)

Оставьте комментарий

Войдите, чтобы присоединиться к обсуждению