Токен
Минимальная единица текста, которой оперирует языковая модель: примерно часть слова. И запрос, и ответ модель считает в токенах — от их количества зависит и объём контекста, и стоимость запроса.
Модель не видит буквы или слова напрямую — она разбивает текст на токены. В среднем для русского языка один токен это примерно 2–3 символа, для английского около 4. То есть слово может занимать один или несколько токенов, а пробелы и знаки препинания тоже считаются.
В API токены важны по двум причинам: они ограничены контекстным окном (сколько модель способна прочитать за раз) и по ним считается расход. В ответе на запрос поле usage показывает prompt_tokens (что вы отправили) и completion_tokens (что модель сгенерировала).
- Длинный системный промпт и история диалога тратят токены в каждом запросе — их стоит держать компактными.
- Параметр
max_tokensограничивает длину ответа, но не длину запроса. - Точную цену моделей за токены смотрите в каталоге — она всегда актуальна.