Как считать стоимость запроса к языковой модели
Из чего складывается цена одного запроса: входные и выходные токены, длина контекста, reasoning-токены. Формулы для оценки расхода заранее — без привязки к конкретным цифрам.
Стоимость запроса к языковой модели считается не «за запрос», а за токены — и входные, и выходные. Понимая формулу, вы оцените бюджет фичи ещё до первой строки кода и не удивитесь счёту. Разберём слагаемые и как прикинуть расход заранее. Механику самих токенов разбирает гайд что такое токены.
Формула: две ставки, а не одна
У каждой модели две ставки — за входные (prompt) и за выходные (completion) токены. Выходные обычно дороже входных. Стоимость запроса складывается так:
стоимость = prompt_tokens × ставка_ввода
+ completion_tokens × ставка_выводаАктуальные ставки по каждой модели — на странице каталога и в живой таблице ниже; они меняются, поэтому в тексте мы их не фиксируем, а показываем прямо из каталога:
| Модель | Ввод, ₽/1М | Вывод, ₽/1М | Контекст |
|---|---|---|---|
| Anthropic: Claude Sonnet 5 | 314 | 1 568 | 1M |
| OpenAI: GPT-5.4 | 392 | 2 351 | 1.1M |
| Google: Gemini 3.5 Flash | 235 | 1 411 | 1.0M |
| DeepSeek: DeepSeek V3 | 31 | 125 | 128K |
Что входит во входные токены
Входные токены — это не только текущий вопрос пользователя. В каждый запрос уходит весь контекст:
- Системный промпт — инструкции роли и формата; отправляется с каждым запросом.
- История диалога — все предыдущие сообщения, если вы ведёте многоходовой разговор. Чем длиннее диалог, тем дороже каждый следующий шаг.
- Вложенные данные — фрагменты документов при RAG, примеры для few-shot, содержимое файлов.
- Текущее сообщение пользователя.
Длина контекста и reasoning-токены
- Длина контекста влияет на цену напрямую: чем больше вы кладёте на вход (большой документ, длинная история), тем больше входных токенов оплачиваете. Само по себе большое контекстное окно — это лимит, а не расход; платите вы за фактически отправленные токены.
- Reasoning-токены — у рассуждающих моделей есть скрытый этап «размышления» перед ответом. Эти токены обычно тарифицируются как выходные, хотя в финальном тексте их не видно. Для сложных reasoning-моделей закладывайте запас сверх видимого ответа.
Как оценить расход заранее
- Прикиньте типичный размер входа: системный промпт + средняя история + данные. Для русского текста берите запас — кириллица даёт больше токенов.
- Оцените типичный размер ответа и задайте
max_tokensкак потолок. - Подставьте в формулу актуальные ставки модели из каталога — получите цену одного запроса.
- Умножьте на ожидаемое число запросов в день или месяц — это бюджет фичи.
- Сверьте оценку с фактом: после первых реальных запросов поле
usageпокажет точный расход, и вы уточните модель расчёта.
Частые вопросы
Почему выходные токены дороже входных?
Генерация ответа вычислительно тяжелее, чем чтение входа: модель порождает каждый токен последовательно. Поэтому у большинства моделей ставка за вывод выше, и на неё стоит смотреть в первую очередь при длинных ответах.
Как узнать точную стоимость запроса постфактум?
Из поля usage в ответе API берите prompt_tokens и completion_tokens, умножьте на ставки модели. В кабинете AI Gateway расход по каждому ключу считается автоматически и виден в реальном времени.
Можно ли зафиксировать максимальную стоимость запроса?
Частично: параметр max_tokens ограничивает длину ответа, а значит верхнюю границу выходных токенов. Дополнительно ключу в кабинете можно задать месячную квоту и стоп-лимит, чтобы перерасход не списался.
Прозрачный расход по токенам в рублях
Открыть каталог