Работа с изображениями (vision) через AI Gateway
Как отправлять картинки в модель: image_url в messages, сценарии OCR, описания товаров и разбора скриншотов, пример кода на Python — с оплатой в рублях.
Vision-модели принимают на вход не только текст, но и изображения: фото, скриншоты, сканы документов, схемы. Модель «видит» картинку и отвечает по её содержимому — извлекает текст, описывает объекты, отвечает на вопросы по изображению. В AI Gateway это работает через стандартное поле image_url в массиве messages, как в оригинальном API OpenAI.
Как это работает
В сообщение пользователя вместо строки передаётся массив частей: текстовая часть с вопросом и часть типа image_url с картинкой. Изображение можно указать ссылкой (https://…) или встроить прямо в запрос как data URL в base64 — удобно для локальных файлов, которые не выложены в интернет.
from openai import OpenAI
client = OpenAI(
base_url="https://ai-gatewey.ru/v1",
api_key="sk-aigate-ваш_ключ",
)
resp = client.chat.completions.create(
model="openai/gpt-5.4-mini",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Что изображено на картинке? Извлеки весь текст."},
{"type": "image_url", "image_url": {"url": "https://example.com/receipt.jpg"}},
],
}],
)
print(resp.choices[0].message.content){"url": "data:image/jpeg;base64," + b64}. Так картинку не нужно выкладывать в открытый доступ.Сценарии
- OCR и распознавание документов — извлечение текста из чеков, счетов, паспортов, рукописных заметок с сохранением структуры.
- Описания товаров — автогенерация карточек интернет-магазина по фотографии: цвет, материал, тип, ключевые признаки.
- Разбор скриншотов — анализ интерфейсов, ошибок на экране, графиков и дашбордов; поддержка пользователей по присланному скриншоту.
- Модерация и контроль — проверка, что на изображении нет запрещённого контента или что фото соответствует требованиям.
- Доступность — генерация alt-текста и подписей к изображениям для скринридеров.
Частые вопросы
Какие модели умеют работать с изображениями?
Только модели с поддержкой vision — их актуальный список собирается живьём ниже по каталогу. На карточке в каталоге у таких моделей есть бейдж «зрение».
Можно ли отправить несколько изображений в одном запросе?
Да — добавьте в массив content несколько частей image_url. Учтите, что каждая картинка увеличивает число входных токенов и стоимость запроса.
Поддерживается ли генерация изображений?
Это отдельная возможность: за создание картинок отвечают image-модели каталога (например, с суффиксом -image), а vision — это разбор уже готовых изображений на входе.
Отправьте первое изображение в модель
Получить ключМодели с этой возможностью
Живой срез каталога — цены за 1 млн токенов:
| Модель | Цена, ₽/1М | Контекст |
|---|---|---|
| Anthropic: Claude Opus 4.8 | 3 919 | 1M |
| Mistral: Mistral Medium 3.5 | 1 176 | 262K |
| xAI: Grok 4.3 | 392 | 1M |
| OpenAI: GPT-5.5 | 4 703 | 1.1M |
| Meta: Llama 4 Maverick | 94 | 1.0M |
| Anthropic: Claude Sonnet 5 | 1 568 | 1M |
| Qwen: Qwen3.6 Plus | 306 | 1M |
| OpenAI GPT Latest | 4 703 | 1.1M |
| Mistral: Mistral Medium 3 | 314 | 131K |
| OpenAI GPT Mini Latest | 705 | 400K |
| OpenAI: GPT Chat Latest | 4 703 | 400K |
| Google: Gemma 3 27B | 25 | 131K |