Стриминг (потоковый ответ)
Режим, при котором модель отдаёт ответ по частям, по мере генерации, а не целиком в конце. Пользователь видит текст, появляющийся слово за словом — как в чат-интерфейсах. Включается параметром stream: true.
Обычный запрос ждёт, пока модель сгенерирует ответ полностью, и только потом возвращает его. При стриминге сервер начинает отдавать токены сразу же, потоком событий — это заметно улучшает воспринимаемую скорость в интерфейсах.
- Включается флагом
stream: trueв теле запроса к API. - Ответ приходит серией фрагментов, которые нужно склеивать на стороне клиента.
- Итоговое количество токенов и полный текст вы получаете, собрав все фрагменты потока.
Стриминг не делает генерацию быстрее по времени и не меняет расход — он лишь показывает результат раньше. Подробности в документации.