Возможности API

Работа с изображениями (vision) через AI Gateway

Как отправлять картинки в модель: image_url в messages, сценарии OCR, описания товаров и разбора скриншотов, пример кода на Python — с оплатой в рублях.

Vision-модели принимают на вход не только текст, но и изображения: фото, скриншоты, сканы документов, схемы. Модель «видит» картинку и отвечает по её содержимому — извлекает текст, описывает объекты, отвечает на вопросы по изображению. В AI Gateway это работает через стандартное поле image_url в массиве messages, как в оригинальном API OpenAI.

Как это работает

В сообщение пользователя вместо строки передаётся массив частей: текстовая часть с вопросом и часть типа image_url с картинкой. Изображение можно указать ссылкой (https://…) или встроить прямо в запрос как data URL в base64 — удобно для локальных файлов, которые не выложены в интернет.

from openai import OpenAI

client = OpenAI(
    base_url="https://ai-gatewey.ru/v1",
    api_key="sk-aigate-ваш_ключ",
)

resp = client.chat.completions.create(
    model="openai/gpt-5.4-mini",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "Что изображено на картинке? Извлеки весь текст."},
            {"type": "image_url", "image_url": {"url": "https://example.com/receipt.jpg"}},
        ],
    }],
)
print(resp.choices[0].message.content)
Локальный файл кодируйте в base64 и передавайте как data URL: {"url": "data:image/jpeg;base64," + b64}. Так картинку не нужно выкладывать в открытый доступ.

Сценарии

  • OCR и распознавание документов — извлечение текста из чеков, счетов, паспортов, рукописных заметок с сохранением структуры.
  • Описания товаров — автогенерация карточек интернет-магазина по фотографии: цвет, материал, тип, ключевые признаки.
  • Разбор скриншотов — анализ интерфейсов, ошибок на экране, графиков и дашбордов; поддержка пользователей по присланному скриншоту.
  • Модерация и контроль — проверка, что на изображении нет запрещённого контента или что фото соответствует требованиям.
  • Доступность — генерация alt-текста и подписей к изображениям для скринридеров.
Изображения тарифицируются как входные токены и стоят заметно дороже текста: чем больше разрешение, тем больше токенов. Уменьшайте картинку до разумного размера, если высокая детализация не нужна.

Частые вопросы

Какие модели умеют работать с изображениями?

Только модели с поддержкой vision — их актуальный список собирается живьём ниже по каталогу. На карточке в каталоге у таких моделей есть бейдж «зрение».

Можно ли отправить несколько изображений в одном запросе?

Да — добавьте в массив content несколько частей image_url. Учтите, что каждая картинка увеличивает число входных токенов и стоимость запроса.

Поддерживается ли генерация изображений?

Это отдельная возможность: за создание картинок отвечают image-модели каталога (например, с суффиксом -image), а vision — это разбор уже готовых изображений на входе.

Отправьте первое изображение в модель

Получить ключ

Модели с этой возможностью

Живой срез каталога — цены за 1 млн токенов:

Все модели с фильтром по возможностям →