Как выбрать модель под задачу: методика
Методика подбора языковой модели по четырём осям — качество, цена, скорость, контекст. Каскады моделей и приём «дешёвая по умолчанию, дорогая по требованию».
«Самая мощная модель» — почти никогда не лучший ответ на вопрос выбора. Флагман избыточен для классификации и разорителен на массовых операциях, а лёгкая модель не потянет сложный рефакторинг. Правильный выбор — это баланс четырёх осей под конкретную задачу. Разберём методику и приёмы экономии.
Четыре оси выбора
| Ось | Когда критична | На что смотреть |
|---|---|---|
| Качество | Сложные рассуждения, код, анализ | Класс модели: флагман против лёгкой |
| Цена | Массовые запросы, большой объём | Ставки за входные/выходные токены |
| Скорость | Интерактив, чат, автодополнение | Латентность и время до первого токена |
| Контекст | Длинные документы, большая история | Размер контекстного окна |
Оси конфликтуют: максимум качества обычно означает большую цену и меньшую скорость. Задача — не выкрутить всё на максимум, а понять, что для вашего сценария критично, а чем можно пожертвовать.
Разные классы под разные задачи
В каталоге есть модели разных классов — от лёгких и быстрых до флагманских. Сравните их по цене и позиционированию прямо из каталога:
| Модель | Ввод, ₽/1М | Вывод, ₽/1М | Контекст |
|---|---|---|---|
| Anthropic: Claude Opus 4.8 | 784 | 3 919 | 1M |
| Anthropic: Claude Sonnet 5 | 314 | 1 568 | 1M |
| Anthropic Claude Haiku Latest | 157 | 784 | 200K |
| OpenAI: GPT-5.4 Mini | 118 | 705 | 400K |
| DeepSeek: DeepSeek V3 | 31 | 125 | 128K |
- Флагманы (Opus, старшие GPT) — сложные рассуждения, архитектура, большие рефакторинги, где ошибка дорого стоит.
- Средний тир (Sonnet, gpt-5.4) — модель «по умолчанию»: баланс цены и качества для повседневной работы.
- Лёгкие модели (Haiku, mini, deepseek-chat) — массовые операции: классификация, извлечение, короткие ответы, где важны цена и скорость.
Каскады моделей
Мощный приём экономии — каскад: запрос сначала обрабатывает дешёвая модель, а дорогая подключается только когда дешёвая не справилась. Так вы платите за флагман лишь на тех запросах, где он действительно нужен:
- Роутинг по сложности — простые запросы уходят на лёгкую модель, сложные — на флагман. Классификатор сложности сам может быть дешёвой моделью.
- Эскалация по уверенности — если лёгкая модель ответила неуверенно или ответ не прошёл проверку, тот же запрос переотправляется на модель классом выше.
- Черновик и доводка — быстрая модель делает черновик, флагман его правит; иногда дешевле, чем сразу генерировать флагманом.
model в том же запросе. Не нужно держать интеграции с разными провайдерами — все модели каталога доступны по одному ключу.Как принять решение
- Определите критичную ось: это качество любой ценой, минимальная цена на объёме или скорость для интерактива?
- Возьмите средний тир как отправную точку и проверьте на реальных задачах.
- Если качества хватает — попробуйте спуститься на класс ниже и сэкономить; если нет — поднимитесь на флагман.
- Для смешанной нагрузки заложите каскад вместо одной модели на всё.
- Сравнивайте модели на своих данных, а не по общим заявлениям — единый API это упрощает.
Частые вопросы
С какой модели начать, если не знаю требований?
Со среднего тира — Sonnet или сопоставимого GPT. Он покрывает большинство задач с адекватной ценой. Дальше по фактам: качества с запасом — пробуйте дешевле, не хватает — поднимайтесь к флагману.
Каскад моделей реально экономит?
Да, когда в потоке много простых запросов и мало сложных. Дешёвая модель закрывает основную массу, флагман подключается точечно. Если почти все запросы сложные, выигрыша не будет — проще сразу взять сильную модель.
Как честно сравнить две модели?
Прогоните обе на одном наборе своих реальных задач и сравните результат и стоимость по полю usage. Через единый API это смена одного параметра model — не нужно менять код или заводить второй ключ.
Все классы моделей по одному ключу
Открыть каталог