Экономия на токенах: как платить за LLM меньше
Практичные приёмы снизить счёт за LLM: короткие промпты, кеширование, дешёвые модели для простых шагов, каскад моделей и лимиты на ключ. С примерами кода и живыми ценами.
Счёт за LLM растёт не от «дорогих» моделей, а от невнимательности: раздутые промпты, повторная отправка одного и того же контекста, флагман там, где хватило бы лёгкой модели. Ниже — приёмы, которые снижают расход без потери качества, и способ поставить жёсткий потолок трат.
Короткие и точные промпты
- Убирайте воду: вежливые вступления и повторы инструкций тратят токены на входе в каждом запросе.
- Не вставляйте весь документ, если задаче нужен один раздел — предварительно отберите релевантный фрагмент.
- Ограничивайте длину ответа параметром
max_tokens: модель не будет «доливать» лишнего, а вы не заплатите за выход, который не читаете. - Просите структурированный вывод (JSON, список) — он короче свободного текста и не требует постобработки.
Кешируйте то, что повторяется
Если системный промпт или большой контекст одинаковы в серии запросов, не гоняйте их заново каждый раз. Кешируйте ответы для одинаковых входов на своей стороне, а внутри диалога держите историю компактной — суммируйте старые сообщения вместо того, чтобы тащить их целиком.
Дешёвые модели для простых шагов
Классификация, извлечение полей, короткие саммари, теги — всё это не требует флагмана. Лёгкие и бюджетные модели справляются с рутиной за долю стоимости. Вот удачные кандидаты на «дешёвый» слой:
| Модель | Ввод, ₽/1М | Вывод, ₽/1М | Контекст |
|---|---|---|---|
| DeepSeek: DeepSeek V3 | 31 | 125 | 128K |
| OpenAI: GPT-5.4 Mini | 118 | 705 | 400K |
| Anthropic Claude Haiku Latest | 157 | 784 | 200K |
Каскад моделей
Каскад — это когда дешёвая модель делает первый проход, а флагман подключается только для сложных случаев. Например: лёгкая модель размечает поток и отдаёт наверх лишь то, в чём «не уверена». Так основной объём обрабатывается дёшево, а качество на трудных примерах не страдает.
from openai import OpenAI
client = OpenAI(
base_url="https://ai-gatewey.ru/v1",
api_key="sk-aigate-ваш_ключ",
)
def classify(text: str) -> str:
# Дешёвый первый проход
cheap = client.chat.completions.create(
model="deepseek/deepseek-chat",
messages=[{"role": "user", "content": f"Тема обращения одним словом: {text}"}],
max_tokens=8,
)
label = cheap.choices[0].message.content.strip()
if label.lower() != "непонятно":
return label
# Эскалация на сильную модель только для спорных случаев
strong = client.chat.completions.create(
model="anthropic/claude-sonnet-5",
messages=[{"role": "user", "content": f"Определи тему обращения: {text}"}],
max_tokens=16,
)
return strong.choices[0].message.content.strip()Поставьте потолок расходов
Экономия — это не только приёмы, но и защита от сюрпризов. На каждом ключе AI Gateway можно задать RPM-лимит, месячную квоту и стоп-лимит перерасхода, а расход виден в кабинете в реальном времени. Разбейте ключи по проектам — и один сбойный цикл не съест бюджет всей команды.
Частые вопросы
На чём экономить в первую очередь?
На входе. Сократите промпты и контекст, ограничьте max_tokens — это даёт эффект сразу и без риска для качества. Смена модели на более дешёвую — следующий шаг.
Не потеряю ли я в качестве на дешёвых моделях?
На простых шагах — нет: классификация и извлечение полей им по силам. Ключ в том, чтобы отправлять флагману только действительно сложные случаи через каскад.
Как не превысить бюджет случайно?
Задайте на ключе месячную квоту и стоп-лимит перерасхода, следите за расходом в кабинете. Условия тарифов и PAYG — на странице тарифов.
Лимиты на ключ и расход в реальном времени
Получить ключ