NVIDIA Nemotron 3: обзор линейки Nano, Super и Ultra с ценами в рублях
Открытые модели NVIDIA Nemotron 3 через API без VPN: три размера от Nano до Ultra, гибридная архитектура Mamba-Transformer, контекст 256k и цены в рублях — какой размер брать под задачу.
Nemotron 3 — линейка открытых моделей NVIDIA, рассчитанная на агентные системы. В каталоге доступны три размера: Nano, Super и Ultra. Разброс цены между младшей и старшей — больше чем в десять раз, поэтому здесь выбор размера решает больше, чем выбор вендора.
Три размера
| Модель | Параметры | Контекст | Вышла |
|---|---|---|---|
| Nemotron 3 Nano | 30 млрд всего, 3 млрд активных | 262 144 токена | 14 декабря 2025 |
| Nemotron 3 Super | 120 млрд всего, 12 млрд активных | 262 144 токена | 11 марта 2026 |
| Nemotron 3 Ultra | 550 млрд всего, 55 млрд активных | 262 144 токена | 4 июня 2026 |
Все три — гибрид Mamba и Transformer в схеме Mixture-of-Experts: на каждый токен работает около десятой части параметров. Контекст у всей линейки одинаковый — 262 144 токена, то есть примерно 400 страниц текста. Возможности тоже общие: вызов инструментов и JSON-режим.
Актуальные цены
Цены в рублях за 1 млн токенов, обновляются вместе с каталогом. Обратите внимание на шаг между размерами — он и должен определять выбор.
| Модель | Ввод, ₽/1М | Вывод, ₽/1М | Контекст |
|---|---|---|---|
| NVIDIA: Nemotron 3 Nano 30B A3B | 8 | 31 | 262K |
| NVIDIA: Nemotron 3 Super | 22 | 105 | 262K |
| NVIDIA: Nemotron 3 Ultra | 83 | 366 | 262K |
Какой размер брать
- Nano — один из самых дешёвых вариантов в каталоге при контексте 256k. Подходит для узких специализированных агентов: классификация, маршрутизация запросов, простые инструменты в цепочке.
- Super — середина линейки. Разумная точка старта, если Nano на ваших запросах уже не справляется, а платить за Ultra рано.
- Ultra — старшая модель, входит в тарифы Pro и Max. Оправдана на сложной оркестрации: много инструментов, длинные цепочки, ветвление решений.
model.Частые вопросы
Что даёт гибридная архитектура Mamba-Transformer?
Это способ удешевить работу с длинным контекстом: часть слоёв обрабатывает последовательность иначе, чем классическое внимание. Для пользователя API разницы в интерфейсе нет — она отражается в цене и скорости, а не в формате запроса.
«Открытые модели» — это про лицензию?
Да, NVIDIA публикует веса Nemotron открыто. Через AI Gateway они доступны как обычные модели каталога по тому же OpenAI-совместимому API — разворачивать ничего не нужно.
Почему у всех трёх одинаковый контекст?
Так устроена линейка: размер модели растёт, окно остаётся 262 144 токена. Если нужен контекст больше, стоит смотреть на модели с окном в 1 млн — например DeepSeek V4 или GLM 5.2.
Нужен ли VPN?
Нет. Запросы идут на российский домен ai-gatewey.ru/v1, оплата в рублях с карты или по счёту для юрлиц.
Nemotron 3 по единому API в рублях
Получить ключ