Возможности API

Думающие модели (reasoning) через AI Gateway

Когда включать рассуждающие модели: как работает reasoning, для каких задач он оправдан, при чём тут токены рассуждений и пример кода на Python.

Думающие (reasoning) модели перед ответом строят внутреннюю цепочку рассуждений: разбивают задачу на шаги, проверяют промежуточные выводы и лишь потом дают финальный ответ. Это заметно повышает качество на сложных задачах — математике, логике, многошаговом коде — ценой большей задержки и большего расхода токенов. В AI Gateway такие модели вызываются тем же OpenAI-совместимым API, что и обычные.

Как это работает

Reasoning-модель тратит часть работы на «размышление» до ответа. Эти внутренние рассуждения оплачиваются как отдельные токены рассуждений (reasoning tokens) — они не всегда видны в ответе, но входят в расход. У многих моделей глубину размышления можно регулировать параметром усилия (reasoning_effort): выше усилие — точнее ответ на трудных задачах, но дольше и дороже.

from openai import OpenAI

client = OpenAI(
    base_url="https://ai-gatewey.ru/v1",
    api_key="sk-aigate-ваш_ключ",
)

resp = client.chat.completions.create(
    model="openai/gpt-5.5",
    messages=[{
        "role": "user",
        "content": "В корзине 3 красных и 5 синих шаров. Вынули 2 без возврата. "
                   "Какова вероятность, что оба синих? Распиши решение.",
    }],
    reasoning_effort="high",
)
print(resp.choices[0].message.content)

Сценарии

  • Сложная математика и логика — задачи, где важна цепочка шагов, а не эрудиция: расчёты, доказательства, комбинаторика.
  • Многошаговый код — проектирование архитектуры, разбор запутанных багов, рефакторинг с учётом множества условий.
  • Анализ и планирование — разбор длинных документов, сопоставление противоречивых требований, построение стратегии из многих факторов.
  • Проверка и самокритика — когда нужна не первая пришедшая мысль, а перепроверенный ответ.
Для простых задач — короткие ответы, извлечение данных, чат по FAQ — reasoning избыточен: он добавит задержку и расход токенов рассуждений без выигрыша в качестве. Включайте думающие модели там, где обычная ошибается.

Частые вопросы

Какие модели умеют рассуждать?

Модели с поддержкой reasoning — их актуальный список собирается живьём ниже по каталогу. На карточке в каталоге такие модели помечены соответствующим бейджем.

Почему расход токенов больше, чем длина ответа?

Помимо видимого ответа, модель тратит токены рассуждений на внутреннюю цепочку размышлений. Они входят в расход, даже если не показаны в тексте. Фактический расход всегда виден в кабинете в реальном времени.

Можно ли ускорить думающую модель?

Да — снизьте параметр усилия (reasoning_effort до low или medium), если задача не требует максимальной глубины. Это сократит задержку и число токенов рассуждений.

Проверьте думающую модель на своей задаче

Получить ключ

Модели с этой возможностью

Живой срез каталога — цены за 1 млн токенов:

Все модели с фильтром по возможностям →