К содержимому
Обзоры

NVIDIA Nemotron 3: обзор линейки Nano, Super и Ultra с ценами в рублях

Открытые модели NVIDIA Nemotron 3 через API без VPN: три размера от Nano до Ultra, гибридная архитектура Mamba-Transformer, контекст 256k и цены в рублях — какой размер брать под задачу.

2 минуты чтенияNVIDIANemotronобзороткрытые модели

Nemotron 3 — линейка открытых моделей NVIDIA, рассчитанная на агентные системы. В каталоге доступны три размера: Nano, Super и Ultra. Разброс цены между младшей и старшей — больше чем в десять раз, поэтому здесь выбор размера решает больше, чем выбор вендора.

Три размера

МодельПараметрыКонтекстВышла
Nemotron 3 Nano30 млрд всего, 3 млрд активных262 144 токена14 декабря 2025
Nemotron 3 Super120 млрд всего, 12 млрд активных262 144 токена11 марта 2026
Nemotron 3 Ultra550 млрд всего, 55 млрд активных262 144 токена4 июня 2026

Все три — гибрид Mamba и Transformer в схеме Mixture-of-Experts: на каждый токен работает около десятой части параметров. Контекст у всей линейки одинаковый — 262 144 токена, то есть примерно 400 страниц текста. Возможности тоже общие: вызов инструментов и JSON-режим.

Актуальные цены

Цены в рублях за 1 млн токенов, обновляются вместе с каталогом. Обратите внимание на шаг между размерами — он и должен определять выбор.

МодельВвод, ₽/1МВывод, ₽/1МКонтекст
NVIDIA: Nemotron 3 Nano 30B A3B831262K
NVIDIA: Nemotron 3 Super22105262K
NVIDIA: Nemotron 3 Ultra83366262K
Актуальные цены каталога AI Gateway за 1 млн токенов. Все модели →

Какой размер брать

  • Nano — один из самых дешёвых вариантов в каталоге при контексте 256k. Подходит для узких специализированных агентов: классификация, маршрутизация запросов, простые инструменты в цепочке.
  • Super — середина линейки. Разумная точка старта, если Nano на ваших запросах уже не справляется, а платить за Ultra рано.
  • Ultra — старшая модель, входит в тарифы Pro и Max. Оправдана на сложной оркестрации: много инструментов, длинные цепочки, ветвление решений.
Линейка из трёх размеров с одинаковым API — удобный случай для двухуровневой схемы: дешёвая модель обрабатывает поток, а на сложных случаях запрос уходит к старшей. Меняется только код модели в параметре model.

Частые вопросы

Что даёт гибридная архитектура Mamba-Transformer?

Это способ удешевить работу с длинным контекстом: часть слоёв обрабатывает последовательность иначе, чем классическое внимание. Для пользователя API разницы в интерфейсе нет — она отражается в цене и скорости, а не в формате запроса.

«Открытые модели» — это про лицензию?

Да, NVIDIA публикует веса Nemotron открыто. Через AI Gateway они доступны как обычные модели каталога по тому же OpenAI-совместимому API — разворачивать ничего не нужно.

Почему у всех трёх одинаковый контекст?

Так устроена линейка: размер модели растёт, окно остаётся 262 144 токена. Если нужен контекст больше, стоит смотреть на модели с окном в 1 млн — например DeepSeek V4 или GLM 5.2.

Нужен ли VPN?

Нет. Запросы идут на российский домен ai-gatewey.ru/v1, оплата в рублях с карты или по счёту для юрлиц.

Nemotron 3 по единому API в рублях

Получить ключ