Reasoning-модели: что это, когда включать и чем платишь
Как устроены думающие (reasoning) модели, на каких задачах они выигрывают, а где только жгут токены рассуждений. Обзор reasoning-моделей и практика управления затратами.
«Думающие» (reasoning) модели перед ответом строят внутреннюю цепочку рассуждений — как черновик на полях, который вы не видите, но за который платите. На сложных задачах это заметно поднимает качество, на простых — просто жжёт токены. Разберём, как это устроено и когда режим оправдан.
Как это работает
Обычная модель отвечает сразу. Reasoning-модель сначала генерирует скрытые рассуждения — разбивает задачу на шаги, проверяет варианты, отбрасывает тупики — и только потом выдаёт ответ. Эти рассуждения расходуют выходные токены, поэтому запрос стоит дороже и отвечает медленнее, зато на многошаговых задачах реже ошибается.
Когда включать
- Математика и логика — задачи в несколько шагов, где важна каждая промежуточная выкладка.
- Сложный код и алгоритмы — разбор нетривиальной логики, планирование рефакторинга, поиск причины бага.
- Анализ и планирование — сравнение вариантов с обоснованием, разбор длинных условий, стратегические решения.
Когда не стоит
- Классификация и извлечение — короткий чёткий ответ рассуждения не улучшат, а цену поднимут.
- Простые чат-ответы и переформулировки — обычной модели достаточно, режим только замедлит.
- Массовый поток — на больших объёмах рассуждения превращаются в основную статью расходов.
Reasoning-модели в каталоге
Флагманы всех линеек умеют рассуждать. Через AI Gateway они доступны за одним ключом с оплатой в рублях — сравните цены, помня, что в счёт входят и токены рассуждений:
| Модель | Ввод, ₽/1М | Вывод, ₽/1М | Контекст |
|---|---|---|---|
| Anthropic: Claude Opus 4.8 | 784 | 3 919 | 1M |
| OpenAI: GPT-5.5 | 784 | 4 703 | 1.1M |
| Google: Gemini 3.1 Pro Preview | 314 | 1 881 | 1.0M |
| DeepSeek: DeepSeek V3 | 31 | 125 | 128K |
Чем платишь
Токены рассуждений тарифицируются как обычный выход, но вы их не видите в ответе. Поэтому reasoning-запрос при том же финальном тексте обходится дороже. Контролируйте это как обычный расход: следите за потреблением в кабинете и держите на ключе месячную квоту и стоп-лимит перерасхода.
from openai import OpenAI
client = OpenAI(
base_url="https://ai-gatewey.ru/v1",
api_key="sk-aigate-ваш_ключ",
)
resp = client.chat.completions.create(
model="anthropic/claude-opus-4.8",
messages=[{"role": "user", "content": "Спланируй рефакторинг модуля биллинга по шагам с обоснованием каждого"}],
)
print(resp.choices[0].message.content)
# в usage будут учтены и скрытые токены рассуждений
print(resp.usage)Частые вопросы
Reasoning-модель всегда точнее обычной?
Только на задачах с многошаговой логикой — математика, сложный код, анализ. На классификации и коротких ответах выигрыша нет, а цена и задержка растут.
Почему запрос стоит дороже, если ответ короткий?
Скрытые рассуждения тоже расходуют выходные токены и попадают в счёт, хотя в тексте ответа их нет. Поэтому reasoning-запрос дороже обычного при том же финальном объёме.
Как не переплачивать за рассуждения?
Включайте режим точечно — только на сложных задачах, а поток держите на обычной модели через каскад. Ограничьте расход квотой на ключ и следите за потреблением в кабинете.
Reasoning-модели — за одним ключом и в рублях
Попробовать