Основы

Как выбрать модель под задачу: методика

Методика подбора языковой модели по четырём осям — качество, цена, скорость, контекст. Каскады моделей и приём «дешёвая по умолчанию, дорогая по требованию».

3 минуты чтения

«Самая мощная модель» — почти никогда не лучший ответ на вопрос выбора. Флагман избыточен для классификации и разорителен на массовых операциях, а лёгкая модель не потянет сложный рефакторинг. Правильный выбор — это баланс четырёх осей под конкретную задачу. Разберём методику и приёмы экономии.

Четыре оси выбора

ОсьКогда критичнаНа что смотреть
КачествоСложные рассуждения, код, анализКласс модели: флагман против лёгкой
ЦенаМассовые запросы, большой объёмСтавки за входные/выходные токены
СкоростьИнтерактив, чат, автодополнениеЛатентность и время до первого токена
КонтекстДлинные документы, большая историяРазмер контекстного окна

Оси конфликтуют: максимум качества обычно означает большую цену и меньшую скорость. Задача — не выкрутить всё на максимум, а понять, что для вашего сценария критично, а чем можно пожертвовать.

Разные классы под разные задачи

В каталоге есть модели разных классов — от лёгких и быстрых до флагманских. Сравните их по цене и позиционированию прямо из каталога:

МодельВвод, ₽/1МВывод, ₽/1МКонтекст
Anthropic: Claude Opus 4.87843 9191M
Anthropic: Claude Sonnet 53141 5681M
Anthropic Claude Haiku Latest157784200K
OpenAI: GPT-5.4 Mini118705400K
DeepSeek: DeepSeek V331125128K
Флагман, средний тир и лёгкие модели — цены и лимиты живьём из каталога. Все модели →
  • Флагманы (Opus, старшие GPT) — сложные рассуждения, архитектура, большие рефакторинги, где ошибка дорого стоит.
  • Средний тир (Sonnet, gpt-5.4) — модель «по умолчанию»: баланс цены и качества для повседневной работы.
  • Лёгкие модели (Haiku, mini, deepseek-chat) — массовые операции: классификация, извлечение, короткие ответы, где важны цена и скорость.

Каскады моделей

Мощный приём экономии — каскад: запрос сначала обрабатывает дешёвая модель, а дорогая подключается только когда дешёвая не справилась. Так вы платите за флагман лишь на тех запросах, где он действительно нужен:

  1. Роутинг по сложности — простые запросы уходят на лёгкую модель, сложные — на флагман. Классификатор сложности сам может быть дешёвой моделью.
  2. Эскалация по уверенности — если лёгкая модель ответила неуверенно или ответ не прошёл проверку, тот же запрос переотправляется на модель классом выше.
  3. Черновик и доводка — быстрая модель делает черновик, флагман его правит; иногда дешевле, чем сразу генерировать флагманом.
Через единый API каскад реализуется просто: смена модели — это смена параметра model в том же запросе. Не нужно держать интеграции с разными провайдерами — все модели каталога доступны по одному ключу.

Как принять решение

  1. Определите критичную ось: это качество любой ценой, минимальная цена на объёме или скорость для интерактива?
  2. Возьмите средний тир как отправную точку и проверьте на реальных задачах.
  3. Если качества хватает — попробуйте спуститься на класс ниже и сэкономить; если нет — поднимитесь на флагман.
  4. Для смешанной нагрузки заложите каскад вместо одной модели на всё.
  5. Сравнивайте модели на своих данных, а не по общим заявлениям — единый API это упрощает.

Частые вопросы

С какой модели начать, если не знаю требований?

Со среднего тира — Sonnet или сопоставимого GPT. Он покрывает большинство задач с адекватной ценой. Дальше по фактам: качества с запасом — пробуйте дешевле, не хватает — поднимайтесь к флагману.

Каскад моделей реально экономит?

Да, когда в потоке много простых запросов и мало сложных. Дешёвая модель закрывает основную массу, флагман подключается точечно. Если почти все запросы сложные, выигрыша не будет — проще сразу взять сильную модель.

Как честно сравнить две модели?

Прогоните обе на одном наборе своих реальных задач и сравните результат и стоимость по полю usage. Через единый API это смена одного параметра model — не нужно менять код или заводить второй ключ.

Все классы моделей по одному ключу

Открыть каталог