Сценарии

Embeddings API из России — поиск, RAG и рекомендации

Как построить семантический поиск, RAG и рекомендации из России через единый API-шлюз AI Gateway: эмбеддинги и переранжирование ответов без VPN, оплата в рублях.

Семантический поиск, RAG и рекомендации держатся на векторных представлениях текста — эмбеддингах. Из России доступ к embedding-API упирается в VPN и валютную карту, а качество выдачи часто проседает без финального переранжирования. AI Gateway отдаёт эмбеддинги и чат-модели через один OpenAI-совместимый ключ с оплатой в рублях — и поиск, и переранжирование живут в одном биллинге.

Решение

Пайплайн строится в два слоя: эмбеддинги превращают текст в векторы для быстрого поиска по базе, а чат-модель переранжирует топ-кандидатов и формирует финальный ответ. Оба слоя работают по адресу https://ai-gatewey.ru/v1 и одному ключу sk-aigate-….

  • Семантический поиск — векторный индекс по своей базе знаний вместо поиска по ключевым словам.
  • RAG — извлечение релевантных фрагментов плюс генерация ответа с опорой на них.
  • Рекомендации — подбор похожих товаров, статей или тикетов по близости векторов.
  • Переранжирование — чат-модель отбирает и сортирует топ-кандидатов, повышая точность выдачи.

Подключение

Пример переранжирования: после векторного поиска отдаём топ-кандидатов чат-модели, чтобы она выбрала и упорядочила самые релевантные под конкретный запрос.

from openai import OpenAI

client = OpenAI(
    base_url="https://ai-gatewey.ru/v1",
    api_key="sk-aigate-ваш_ключ",
)

query = "как вернуть товар"
candidates = ["Оплата и возвраты", "Доставка", "Гарантия и обмен"]

resp = client.chat.completions.create(
    model="deepseek/deepseek-chat",
    messages=[{
        "role": "user",
        "content": f"Запрос: {query}\nОтсортируй по релевантности: {candidates}",
    }],
)
print(resp.choices[0].message.content)

Модели и цены

Для переранжирования и генерации ответа в RAG обычно берут дешёвую быструю модель на служебные шаги и более сильную на финальный ответ. Актуальные цены:

МодельВвод, ₽/1МВывод, ₽/1МКонтекст
DeepSeek: DeepSeek V331125128K
OpenAI: GPT-5.4 Mini118705400K
Anthropic: Claude Sonnet 53141 5681M
Актуальные цены каталога AI Gateway за 1 млн токенов. Все модели →
Держите переранжирование на дешёвой модели, а финальную генерацию ответа — на сильной: так вы повышаете точность выдачи, не раздувая расход на каждый запрос.

Частые вопросы

Можно ли строить поиск и RAG без VPN?

Да. Все запросы идут на https://ai-gatewey.ru/v1 по обычному интернету, оплата в рублях. VPN и зарубежная карта не нужны.

Зачем нужно переранжирование, если есть векторный поиск?

Векторный поиск быстро отбирает кандидатов, но не всегда точно упорядочивает их под конкретный запрос. Чат-модель на финальном шаге поднимает точность выдачи, оставаясь дешёвой при работе только с топом.

Хранит ли шлюз мои данные для поиска?

Серверы и данные — в РФ (152-ФЗ), полные промпты в логах не хранятся. Векторный индекс вы держите на своей стороне.

Поиск, RAG и рекомендации — через один ключ

Получить ключ