Гайды

Reasoning-модели: что это, когда включать и чем платишь

Как устроены думающие (reasoning) модели, на каких задачах они выигрывают, а где только жгут токены рассуждений. Обзор reasoning-моделей и практика управления затратами.

2 минуты чтенияreasoningрассуждениягайд

«Думающие» (reasoning) модели перед ответом строят внутреннюю цепочку рассуждений — как черновик на полях, который вы не видите, но за который платите. На сложных задачах это заметно поднимает качество, на простых — просто жжёт токены. Разберём, как это устроено и когда режим оправдан.

Как это работает

Обычная модель отвечает сразу. Reasoning-модель сначала генерирует скрытые рассуждения — разбивает задачу на шаги, проверяет варианты, отбрасывает тупики — и только потом выдаёт ответ. Эти рассуждения расходуют выходные токены, поэтому запрос стоит дороже и отвечает медленнее, зато на многошаговых задачах реже ошибается.

Когда включать

  • Математика и логика — задачи в несколько шагов, где важна каждая промежуточная выкладка.
  • Сложный код и алгоритмы — разбор нетривиальной логики, планирование рефакторинга, поиск причины бага.
  • Анализ и планирование — сравнение вариантов с обоснованием, разбор длинных условий, стратегические решения.

Когда не стоит

  • Классификация и извлечение — короткий чёткий ответ рассуждения не улучшат, а цену поднимут.
  • Простые чат-ответы и переформулировки — обычной модели достаточно, режим только замедлит.
  • Массовый поток — на больших объёмах рассуждения превращаются в основную статью расходов.
Главная ловушка — включить рассуждения «на всякий случай» и платить за них на каждом простом запросе. Режим оправдан там, где качество ответа реально зависит от многошаговой логики.

Reasoning-модели в каталоге

Флагманы всех линеек умеют рассуждать. Через AI Gateway они доступны за одним ключом с оплатой в рублях — сравните цены, помня, что в счёт входят и токены рассуждений:

МодельВвод, ₽/1МВывод, ₽/1МКонтекст
Anthropic: Claude Opus 4.87843 9191M
OpenAI: GPT-5.57844 7031.1M
Google: Gemini 3.1 Pro Preview3141 8811.0M
DeepSeek: DeepSeek V331125128K
Актуальные цены каталога AI Gateway за 1 млн токенов. Все модели →

Чем платишь

Токены рассуждений тарифицируются как обычный выход, но вы их не видите в ответе. Поэтому reasoning-запрос при том же финальном тексте обходится дороже. Контролируйте это как обычный расход: следите за потреблением в кабинете и держите на ключе месячную квоту и стоп-лимит перерасхода.

from openai import OpenAI

client = OpenAI(
    base_url="https://ai-gatewey.ru/v1",
    api_key="sk-aigate-ваш_ключ",
)

resp = client.chat.completions.create(
    model="anthropic/claude-opus-4.8",
    messages=[{"role": "user", "content": "Спланируй рефакторинг модуля биллинга по шагам с обоснованием каждого"}],
)
print(resp.choices[0].message.content)
# в usage будут учтены и скрытые токены рассуждений
print(resp.usage)
Практичный подход — каскад: обычная модель обрабатывает поток, а reasoning-флагман подключается только на действительно сложных случаях. Так вы платите за рассуждения точечно.

Частые вопросы

Reasoning-модель всегда точнее обычной?

Только на задачах с многошаговой логикой — математика, сложный код, анализ. На классификации и коротких ответах выигрыша нет, а цена и задержка растут.

Почему запрос стоит дороже, если ответ короткий?

Скрытые рассуждения тоже расходуют выходные токены и попадают в счёт, хотя в тексте ответа их нет. Поэтому reasoning-запрос дороже обычного при том же финальном объёме.

Как не переплачивать за рассуждения?

Включайте режим точечно — только на сложных задачах, а поток держите на обычной модели через каскад. Ограничьте расход квотой на ключ и следите за потреблением в кабинете.

Reasoning-модели — за одним ключом и в рублях

Попробовать