Основы

Что такое токены и как они считаются на практике

Как языковые модели дробят текст на токены, почему кириллица «дороже» латиницы, где смотреть usage в ответе API и как прикинуть расход заранее.

3 минуты чтения

Токен — это минимальная единица, которой оперирует языковая модель: не буква и не слово, а кусочек текста в 2–4 символа. Модель не «читает» строку целиком, а разбивает её на токены и работает с их числовыми идентификаторами. Именно в токенах считаются и лимит контекста, и стоимость запроса, поэтому понимание этой механики экономит и деньги, и время на отладку. Подробное определение — в глоссарии.

Как текст превращается в токены

Токенизатор разбивает строку по статистике реальных текстов: частые слова становятся одним токеном, редкие — распадаются на части. Грубые ориентиры для прикидки «на глаз»:

  • Английский текст — примерно 1 токен на 4 символа, или около 0,75 слова на токен.
  • Русский текст — токенов заметно больше: кириллица кодируется длиннее, и одно слово нередко разбивается на 2–4 токена.
  • Код — отступы, скобки и знаки пунктуации дробятся мелко, поэтому листинги «съедают» токены быстрее прозы.
  • Числа и служебные символы — часто идут отдельными токенами, особенно длинные числовые последовательности.

Почему кириллица «дороже»

Большинство токенизаторов обучены преимущественно на англоязычных данных, поэтому английские слова упакованы эффективнее. Русский текст тот же смысл выражает бо́льшим числом токенов — на практике в 1,5–2 раза. Это не «наценка сервиса», а свойство самой модели: то же соотношение вы увидите и напрямую у провайдера. Практический вывод: одинаковый по смыслу промпт на русском обойдётся в больше токенов, чем на английском, и это стоит закладывать в оценку.

Токенизатор — часть конкретной модели. У Claude, GPT и Gemini разбиение немного отличается, поэтому один и тот же текст даёт слегка разное число токенов на разных моделях. Для точной оценки ориентируйтесь на фактический usage из ответа, а не на прикидку.

Поле usage: где смотреть факт

Каждый ответ API возвращает объект usage с фактическим расходом токенов. Это источник истины для контроля затрат — прикидки нужны только до запроса, а после запроса всегда есть точная цифра:

{
  "id": "chatcmpl-...",
  "model": "anthropic/claude-sonnet-5",
  "choices": [ /* ... */ ],
  "usage": {
    "prompt_tokens": 42,
    "completion_tokens": 128,
    "total_tokens": 170
  }
}
  • prompt_tokens — всё, что ушло в модель на вход: системный промпт, история диалога и текущее сообщение.
  • completion_tokens — то, что модель сгенерировала в ответ.
  • total_tokens — сумма; именно она определяет расход по запросу.

В кабинете AI Gateway расход по каждому ключу виден в реальном времени, а на странице каталога можно сравнить модели между собой. Стоимость складывается из входных и выходных токенов — механику разбирает гайд как считать стоимость запроса.

Как сократить расход токенов

  • Убирайте лишнее из контекста — длинная история диалога уходит в каждый запрос как входные токены; обрезайте устаревшие сообщения.
  • Просите короткий ответ явно, если развёрнутый не нужен: выходные токены обычно дороже входных.
  • Не дублируйте инструкции — системный промпт отправляется с каждым запросом, держите его компактным.
  • Ограничивайте `max_tokens` сверху, чтобы модель не генерировала лишнего за ваш счёт.

Частые вопросы

Токен — это буква или слово?

Ни то, ни другое. Токен — фрагмент текста в среднем 2–4 символа. Частое слово может быть одним токеном, редкое или длинное — несколькими. Пробелы и знаки препинания тоже считаются.

Почему один и тот же текст даёт разное число токенов на разных моделях?

У каждой модели свой токенизатор, обученный на своих данных. Разбиение отличается, поэтому и число токенов немного разное. Для точного учёта смотрите поле usage в ответе именно той модели, которую используете.

Считаются ли токены системного промпта?

Да. Всё, что уходит на вход, — системный промпт, история и текущее сообщение — попадает в prompt_tokens. Поэтому объёмный системный промпт увеличивает стоимость каждого запроса.

Единый API со счётчиком токенов в реальном времени

Начать бесплатно