Основы

Как считать стоимость запроса к языковой модели

Из чего складывается цена одного запроса: входные и выходные токены, длина контекста, reasoning-токены. Формулы для оценки расхода заранее — без привязки к конкретным цифрам.

3 минуты чтения

Стоимость запроса к языковой модели считается не «за запрос», а за токены — и входные, и выходные. Понимая формулу, вы оцените бюджет фичи ещё до первой строки кода и не удивитесь счёту. Разберём слагаемые и как прикинуть расход заранее. Механику самих токенов разбирает гайд что такое токены.

Формула: две ставки, а не одна

У каждой модели две ставки — за входные (prompt) и за выходные (completion) токены. Выходные обычно дороже входных. Стоимость запроса складывается так:

стоимость = prompt_tokens  × ставка_ввода
          + completion_tokens × ставка_вывода

Актуальные ставки по каждой модели — на странице каталога и в живой таблице ниже; они меняются, поэтому в тексте мы их не фиксируем, а показываем прямо из каталога:

МодельВвод, ₽/1МВывод, ₽/1МКонтекст
Anthropic: Claude Sonnet 53141 5681M
OpenAI: GPT-5.43922 3511.1M
Google: Gemini 3.5 Flash2351 4111.0M
DeepSeek: DeepSeek V331125128K
Цены за токены обновляются автоматически из каталога — сверяйтесь перед расчётом. Все модели →

Что входит во входные токены

Входные токены — это не только текущий вопрос пользователя. В каждый запрос уходит весь контекст:

  • Системный промпт — инструкции роли и формата; отправляется с каждым запросом.
  • История диалога — все предыдущие сообщения, если вы ведёте многоходовой разговор. Чем длиннее диалог, тем дороже каждый следующий шаг.
  • Вложенные данные — фрагменты документов при RAG, примеры для few-shot, содержимое файлов.
  • Текущее сообщение пользователя.
Частая ошибка в оценке — считать только текущий вопрос. В длинном диалоге история накапливается и уходит в каждый запрос как входные токены: десятый шаг разговора дороже первого, даже если сам вопрос короткий. Обрезайте устаревшие сообщения.

Длина контекста и reasoning-токены

  • Длина контекста влияет на цену напрямую: чем больше вы кладёте на вход (большой документ, длинная история), тем больше входных токенов оплачиваете. Само по себе большое контекстное окно — это лимит, а не расход; платите вы за фактически отправленные токены.
  • Reasoning-токены — у рассуждающих моделей есть скрытый этап «размышления» перед ответом. Эти токены обычно тарифицируются как выходные, хотя в финальном тексте их не видно. Для сложных reasoning-моделей закладывайте запас сверх видимого ответа.

Как оценить расход заранее

  1. Прикиньте типичный размер входа: системный промпт + средняя история + данные. Для русского текста берите запас — кириллица даёт больше токенов.
  2. Оцените типичный размер ответа и задайте max_tokens как потолок.
  3. Подставьте в формулу актуальные ставки модели из каталога — получите цену одного запроса.
  4. Умножьте на ожидаемое число запросов в день или месяц — это бюджет фичи.
  5. Сверьте оценку с фактом: после первых реальных запросов поле usage покажет точный расход, и вы уточните модель расчёта.
Экономный приём — каскад моделей: дешёвая модель обрабатывает простые запросы, дорогая подключается только для сложных. Методику выбора разбирает гайд выбор модели для задачи.

Частые вопросы

Почему выходные токены дороже входных?

Генерация ответа вычислительно тяжелее, чем чтение входа: модель порождает каждый токен последовательно. Поэтому у большинства моделей ставка за вывод выше, и на неё стоит смотреть в первую очередь при длинных ответах.

Как узнать точную стоимость запроса постфактум?

Из поля usage в ответе API берите prompt_tokens и completion_tokens, умножьте на ставки модели. В кабинете AI Gateway расход по каждому ключу считается автоматически и виден в реальном времени.

Можно ли зафиксировать максимальную стоимость запроса?

Частично: параметр max_tokens ограничивает длину ответа, а значит верхнюю границу выходных токенов. Дополнительно ключу в кабинете можно задать месячную квоту и стоп-лимит, чтобы перерасход не списался.

Прозрачный расход по токенам в рублях

Открыть каталог