Думающие модели (reasoning) через AI Gateway
Когда включать рассуждающие модели: как работает reasoning, для каких задач он оправдан, при чём тут токены рассуждений и пример кода на Python.
Думающие (reasoning) модели перед ответом строят внутреннюю цепочку рассуждений: разбивают задачу на шаги, проверяют промежуточные выводы и лишь потом дают финальный ответ. Это заметно повышает качество на сложных задачах — математике, логике, многошаговом коде — ценой большей задержки и большего расхода токенов. В AI Gateway такие модели вызываются тем же OpenAI-совместимым API, что и обычные.
Как это работает
Reasoning-модель тратит часть работы на «размышление» до ответа. Эти внутренние рассуждения оплачиваются как отдельные токены рассуждений (reasoning tokens) — они не всегда видны в ответе, но входят в расход. У многих моделей глубину размышления можно регулировать параметром усилия (reasoning_effort): выше усилие — точнее ответ на трудных задачах, но дольше и дороже.
from openai import OpenAI
client = OpenAI(
base_url="https://ai-gatewey.ru/v1",
api_key="sk-aigate-ваш_ключ",
)
resp = client.chat.completions.create(
model="openai/gpt-5.5",
messages=[{
"role": "user",
"content": "В корзине 3 красных и 5 синих шаров. Вынули 2 без возврата. "
"Какова вероятность, что оба синих? Распиши решение.",
}],
reasoning_effort="high",
)
print(resp.choices[0].message.content)Сценарии
- Сложная математика и логика — задачи, где важна цепочка шагов, а не эрудиция: расчёты, доказательства, комбинаторика.
- Многошаговый код — проектирование архитектуры, разбор запутанных багов, рефакторинг с учётом множества условий.
- Анализ и планирование — разбор длинных документов, сопоставление противоречивых требований, построение стратегии из многих факторов.
- Проверка и самокритика — когда нужна не первая пришедшая мысль, а перепроверенный ответ.
Частые вопросы
Какие модели умеют рассуждать?
Модели с поддержкой reasoning — их актуальный список собирается живьём ниже по каталогу. На карточке в каталоге такие модели помечены соответствующим бейджем.
Почему расход токенов больше, чем длина ответа?
Помимо видимого ответа, модель тратит токены рассуждений на внутреннюю цепочку размышлений. Они входят в расход, даже если не показаны в тексте. Фактический расход всегда виден в кабинете в реальном времени.
Можно ли ускорить думающую модель?
Да — снизьте параметр усилия (reasoning_effort до low или medium), если задача не требует максимальной глубины. Это сократит задержку и число токенов рассуждений.
Проверьте думающую модель на своей задаче
Получить ключМодели с этой возможностью
Живой срез каталога — цены за 1 млн токенов:
| Модель | Цена, ₽/1М | Контекст |
|---|---|---|
| Anthropic: Claude Opus 4.8 | 3 919 | 1M |
| Mistral: Mistral Medium 3.5 | 1 176 | 262K |
| xAI: Grok 4.3 | 392 | 1M |
| OpenAI: GPT-5.5 | 4 703 | 1.1M |
| Anthropic: Claude Sonnet 5 | 1 568 | 1M |
| Qwen: Qwen3.6 Plus | 306 | 1M |
| Qwen: Qwen3.7 Max | 588 | 1M |
| NVIDIA: Nemotron 3 Ultra | 345 | 262K |
| Qwen: Qwen3.6 Max Preview | 978 | 262K |
| OpenAI GPT Latest | 4 703 | 1.1M |
| NVIDIA: Llama 3.3 Nemotron Super 49B V1.5 | 63 | 131K |
| OpenAI GPT Mini Latest | 705 | 400K |