Контекстное окно
Максимальный объём текста в токенах, который модель способна учитывать за один запрос: и ваш промпт, и её ответ. Всё, что выходит за пределы окна, модель «не видит» — история диалога обрезается.
Контекстное окно — это оперативная память модели на время одного запроса. В неё должны поместиться системный промпт, вся переданная история сообщений, приложенные документы и место под ответ. У разных моделей объём окна разный.
- Если диалог длинный, обрезайте или суммируйте старые сообщения, иначе упрётесь в лимит окна.
- Загрузка больших документов в промпт быстро расходует окно — иногда выгоднее подход RAG, когда в запрос попадают только нужные фрагменты.
- Размер
max_tokensпод ответ тоже занимает место в окне — оставляйте под него запас.
Превышение контекстного окна приводит к ошибке или молчаливой обрезке начала диалога — модель может «забыть» инструкции из первых сообщений.