Гайды

Экономия на токенах: как платить за LLM меньше

Практичные приёмы снизить счёт за LLM: короткие промпты, кеширование, дешёвые модели для простых шагов, каскад моделей и лимиты на ключ. С примерами кода и живыми ценами.

2 минуты чтенияэкономиятокеныгайд

Счёт за LLM растёт не от «дорогих» моделей, а от невнимательности: раздутые промпты, повторная отправка одного и того же контекста, флагман там, где хватило бы лёгкой модели. Ниже — приёмы, которые снижают расход без потери качества, и способ поставить жёсткий потолок трат.

Короткие и точные промпты

  • Убирайте воду: вежливые вступления и повторы инструкций тратят токены на входе в каждом запросе.
  • Не вставляйте весь документ, если задаче нужен один раздел — предварительно отберите релевантный фрагмент.
  • Ограничивайте длину ответа параметром max_tokens: модель не будет «доливать» лишнего, а вы не заплатите за выход, который не читаете.
  • Просите структурированный вывод (JSON, список) — он короче свободного текста и не требует постобработки.

Кешируйте то, что повторяется

Если системный промпт или большой контекст одинаковы в серии запросов, не гоняйте их заново каждый раз. Кешируйте ответы для одинаковых входов на своей стороне, а внутри диалога держите историю компактной — суммируйте старые сообщения вместо того, чтобы тащить их целиком.

Самый дешёвый токен — тот, который вы не отправили. Прежде чем оптимизировать модель, оптимизируйте вход: часто 30–50% контекста в запросе лишние.

Дешёвые модели для простых шагов

Классификация, извлечение полей, короткие саммари, теги — всё это не требует флагмана. Лёгкие и бюджетные модели справляются с рутиной за долю стоимости. Вот удачные кандидаты на «дешёвый» слой:

МодельВвод, ₽/1МВывод, ₽/1МКонтекст
DeepSeek: DeepSeek V331125128K
OpenAI: GPT-5.4 Mini118705400K
Anthropic Claude Haiku Latest157784200K
Актуальные цены каталога AI Gateway за 1 млн токенов. Все модели →

Каскад моделей

Каскад — это когда дешёвая модель делает первый проход, а флагман подключается только для сложных случаев. Например: лёгкая модель размечает поток и отдаёт наверх лишь то, в чём «не уверена». Так основной объём обрабатывается дёшево, а качество на трудных примерах не страдает.

from openai import OpenAI

client = OpenAI(
    base_url="https://ai-gatewey.ru/v1",
    api_key="sk-aigate-ваш_ключ",
)

def classify(text: str) -> str:
    # Дешёвый первый проход
    cheap = client.chat.completions.create(
        model="deepseek/deepseek-chat",
        messages=[{"role": "user", "content": f"Тема обращения одним словом: {text}"}],
        max_tokens=8,
    )
    label = cheap.choices[0].message.content.strip()
    if label.lower() != "непонятно":
        return label
    # Эскалация на сильную модель только для спорных случаев
    strong = client.chat.completions.create(
        model="anthropic/claude-sonnet-5",
        messages=[{"role": "user", "content": f"Определи тему обращения: {text}"}],
        max_tokens=16,
    )
    return strong.choices[0].message.content.strip()

Поставьте потолок расходов

Экономия — это не только приёмы, но и защита от сюрпризов. На каждом ключе AI Gateway можно задать RPM-лимит, месячную квоту и стоп-лимит перерасхода, а расход виден в кабинете в реальном времени. Разбейте ключи по проектам — и один сбойный цикл не съест бюджет всей команды.

Отдельный ключ на эксперименты с жёсткой квотой — дешёвая страховка от бесконечного цикла в коде агента, который иначе крутил бы запросы до утра.

Частые вопросы

На чём экономить в первую очередь?

На входе. Сократите промпты и контекст, ограничьте max_tokens — это даёт эффект сразу и без риска для качества. Смена модели на более дешёвую — следующий шаг.

Не потеряю ли я в качестве на дешёвых моделях?

На простых шагах — нет: классификация и извлечение полей им по силам. Ключ в том, чтобы отправлять флагману только действительно сложные случаи через каскад.

Как не превысить бюджет случайно?

Задайте на ключе месячную квоту и стоп-лимит перерасхода, следите за расходом в кабинете. Условия тарифов и PAYG — на странице тарифов.

Лимиты на ключ и расход в реальном времени

Получить ключ