Загрузка...

Qwen3 Reranker 8B

Разработчик: Qwen
Идентификатор:
Скопировано!

Характеристики Qwen3 Reranker 8B

Контекстное окно 41K

Дата релиза 13 августа 2026

Мультимодальность

Входящие данные:

  • Текст

Исходящие данные:

  • Rerank

Цены Qwen3 Reranker 8B в рублях

Оплата производится по факту за использованные токены.

Тип
Стоимость
Входящие токены
Тарифицируется каждый входной токен (текст запроса и все переданные документы) при переранжировании. Число токенов провайдер возвращает в поле usage.total_tokens.
21 ₽ / 1M токенов

Цены по провайдерам

RouterAI работает с несколькими провайдерами для обеспечения максимальной доступности и оптимальных цен.

  • 1
    Fireworks
    21 ₽
    Входящие

Умная маршрутизация запросов

Ваши запросы автоматически направляются к провайдеру с самой низкой ценой. Если провайдер недоступен, система мгновенно переключается на следующего по цене, обеспечивая непрерывную работу вашего приложения без потери запросов.

  • Автоматический выбор
  • Отказоустойчивость
  • Лучшая цена

Цены указаны в рублях и могут меняться в зависимости от курса валют

Что умеет Qwen3 Reranker 8B

Qwen3 Reranker 8B — это модель повторной ранжировки текста от Alibaba Cloud, построенная на архитектуре Qwen3. Она оценивает пары запрос-документ для получения оценок релевантности, которые используются в системах поиска и RAG. Поддерживает более 100 языков и языков программирования, с учетом инструкций для повторной ранжировки, что позволяет настраивать критерии оценки для каждой задачи. Обеспечивает высокую производительность на многоязычных тестах, включая MTEB, CMTEB и MMTEB.

API Qwen3 Reranker 8B: подключение и примеры кода

Наш сервис предоставляет единый API, совместимый с OpenAI SDK. Просто укажите наш base_url и используйте ключ, полученный в личном кабинете.

import requests
import json

url = "https://routerai.ru/api/v1/rerank"
headers = {
    "Authorization": "Bearer YOUR_API_KEY",
    "Content-Type": "application/json"
}

data = {
    "model": "qwen/qwen3-reranker-8b",
    "query": "What is the capital of France?",
    "documents": [
        "Paris is the capital of France.",
        "Berlin is the capital of Germany.",
        "The Eiffel Tower is located in Paris."
    ],
    "top_n": 3
}

response = requests.post(url, headers=headers, json=data)
result = response.json()
print(json.dumps(result, indent=2))
curl -X POST "https://routerai.ru/api/v1/rerank" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen/qwen3-reranker-8b",
    "query": "What is the capital of France?",
    "documents": [
      "Paris is the capital of France.",
      "Berlin is the capital of Germany.",
      "The Eiffel Tower is located in Paris."
    ],
    "top_n": 3
  }'

Эндпоинт API

Rerank

Переранжирует документы по релевантности запросу. Для каждого документа возвращает relevance_score.

POST https://routerai.ru/api/v1/rerank
Документация
Authorization
Bearer YOUR_API_KEY
Content-Type
application/json
Model
qwen/qwen3-reranker-8b

Поддерживаемые параметры запроса

Параметр
Тип
По умолчанию
Описание
max_tokens
integer
Верхний предел количества токенов, которые модель может сгенерировать в ответе.
temperature
float
1
Влияет на разнообразие ответов модели: чем выше, тем более случайным будет вывод.
top_p
float
1
Ограничивает выбор модели долей наиболее вероятных токенов: учитываются только токены, чьи вероятности в сумме дают P.
logprobs
boolean
Возвращать ли логарифмы вероятностей выходных токенов.
top_logprobs
integer
Число от 0 до 20: сколько наиболее вероятных токенов возвращать на каждой позиции, каждый с логарифмом вероятности.
response_format
map
Заставляет модель выдавать ответ в определённом формате.
stop
array
Немедленно останавливает генерацию, если модель встречает любой из токенов, указанных в массиве stop.
frequency_penalty
float
0
Управляет повторением токенов в зависимости от того, как часто они встречаются во входных данных.
presence_penalty
float
0
Регулирует, насколько часто модель повторяет токены, уже встречавшиеся во входных данных.
repetition_penalty
float
Снижает вероятность повторения токенов из входных данных, пропорционально тому, как часто они встречаются.
top_k
integer
Ограничивает выбор модели K наиболее вероятными токенами на каждом шаге.
logit_bias
map
Изменяет вероятность появления указанных токенов в ответе.
structured_outputs
boolean
Поддержка ответа по строгой JSON-схеме.