Загрузка...

Gemini 2.5 Flash Lite

Разработчик:
Google
Релиз:
Идентификатор:
google/gemini-2.5-flash-lite

Цены Gemini 2.5 Flash Lite в рублях — от 11 ₽ за 1 млн токенов

Доступно 2 провайдера, цена 11 ₽ за 1 млн токенов.
Провайдер подбирается автоматически — по доступности, затем по цене.

Тип операции Стоимость
Вход За 1 млн токенов
Токены, полученные и обработанные моделью при анализе пользовательского запроса и контекста. Включают текст сообщения, предыдущую историю диалога и все передаваемые данные.
11 ₽
Выход За 1 млн токенов
Токены, генерируемые моделью в виде ответа пользователю. Каждый символ, слово или часть ответа, созданные моделью, включаются в подсчёт выходных токенов.
44 ₽
Кэш: чтение За 1 млн токенов
Повторное использование кэшированного контента снижает затраты благодаря применению пониженного тарифа на эти токены.
1,11 ₽
Кэш: запись За 1 млн токенов
Токены, сохраняемые в промежуточной памяти для последующего переиспользования в рамках одной сессии или нескольких запросов.
9 ₽
Входящие изображения За 1 тыс токенов
Токены, соответствующие обработке визуального контента, передаваемого в качестве входных данных. Изображения преобразуются в токены на основе их разрешения, размера и формата.
0,01 ₽
Входящие аудио За 1 млн токенов
Токены, соответствующие обработке аудиоконтента, передаваемого в качестве входных данных. Аудиофайлы преобразуются в токены на основе их продолжительности и качества.
33 ₽
Размышления За 1 млн токенов
Внутренний, пошаговый анализ проблемы, осуществляемый моделью, позволяет ей оценивать различные подходы, проверять логику и самостоятельно исправлять ошибки перед принятием решения.
44,45 ₽
Веб-поиск За 1 тыс вызовов
Тарифицируется каждый вызов веб-поиска, который модель делает при ответе.
1555 ₽

Возможности Gemini 2.5 Flash Lite

Gemini 2.5 Flash-Lite — это облегчённая модель рассуждений в семействе Gemini 2.5, оптимизированная для сверхнизкой задержки и экономической эффективности. Она обеспечивает улучшенную пропускную способность, более быстрое генерирование токенов и лучшую производительность по общим тестам по сравнению с более ранними моделями Flash. По умолчанию “мышление” (т.е. многократное рассуждение) отключено, чтобы приоритет отдавался скорости, но разработчики могут включить его через параметр Reasoning API, чтобы избирательно обменивать стоимость на интеллект.

Характеристики Gemini 2.5 Flash Lite

Контекстное окно

Всего
1M токенов
На выход
66K токенов

Модальности

Вход
Текст Изображения Файл +2
Выход
Текст

Сильные стороны

Рассуждения
GPQA Diamond: 47,4 %
Вопросы уровня PhD по биологии, физике и химии (подвыборка Diamond).
Поддерживает:
  • Режим рассуждений
  • Вызов инструментов
  • Структурированный вывод
  • Кэш промпта
  • Веб-поиск

Сравнение Gemini 2.5 Flash Lite с другими нейросетями: бенчмарки и рейтинг

Независимые замеры, а не цифры из пресс-релиза: место в рейтинге, сравнение с моделями класса и сколько интеллекта вы получаете за рубль.

Intelligence Index 6,7 № 141 из 153 — выше 6 % моделей
слабее все модели каталога умнее →
Цена ↔ Интеллект топ 33 % индекс 6,7 при 27 ₽ за 1М токенов
хуже все модели каталога лучше →

Gemini 2.5 Flash Lite и модели его класса

Модель Intelligence Coding SciCode GPQA HLE Скорость Отклик Цена Убрать
Mistral Large 2407 Mistral AI 6,8 — 27,1 % 47,2 % 2,9 % — — 444 ₽
GPT-4 OpenAI 6,7 13,1 — 34,9 % — — — 5000 ₽
GLM 4.5V Z AI 6,7 — 18,8 % 57,3 % 3,5 % — — 133 ₽
GPT-4o-mini OpenAI 6,7 11,4 22,9 % 42,6 % 4,2 % — — 41 ₽
Gemini 2.5 Flash Lite эта модель 6,7 — 17,7 % 47,4 % 3,7 % — — 27 ₽

Зелёным — лучшее значение в столбце, цена — среднее входа и выхода за 1М токенов. Данные независимых замеров — Artificial Analysis (замерено 8 октября 2026).

Все замеры модели 12
Intelligence Index
6,7
IFBench
31,5 %
MMLU-Pro
72,4 %
LiveCodeBench
40,0 %
SciCode
17,7 %
Math Index
35,3
AIME
50,0 %
MATH-500
92,6 %
GPQA Diamond
47,4 %
Humanity's Last Exam
3,7 %
τ²-Bench
19,0 %
Terminal-Bench Hard
2,3 %

Провайдеры Gemini 2.5 Flash Lite

Модель развёрнута у 2 провайдеров: вход 11 ₽, выход 44 ₽ за 1 млн токенов.
Порядок выбора по умолчанию: сначала провайдеры без сбоев, среди них — самый дешёвый, остальные подстраховывают.

Как выбрать провайдера через API
Провайдер Вход Выход Кэш: чтение Кэш: запись Контекст
Серверы: США (по штаб-квартире) Google AI Studio 11 ₽ 44 ₽ 1,11 ₽ 9 ₽ 1M
Серверы: США (по штаб-квартире) Google Vertex 11 ₽ 44 ₽ 1,11 ₽ 9 ₽ 1M

Цены считаются по провайдеру, который фактически обработал запрос. Порядок в таблице — по возрастанию цены. Прочерк — провайдер не поддерживает операцию. Флаг — страна серверов или штаб-квартиры провайдера (на мобильном нажмите на первый столбец, на большом экране — на строку).

API Gemini 2.5 Flash Lite:
подключение и примеры кода

API RouterAI совместим с OpenAI SDK: в существующем коде достаточно заменить base_url и ключ, идентификатор модели передаётся в поле model. Один ключ открывает доступ ко всем моделям каталога, лимиты и расход — в личном кабинете.

POST https://routerai.ru/api/v1/chat/completions
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_API_KEY",
    base_url="https://routerai.ru/api/v1"
)

response = client.chat.completions.create(
    model="google/gemini-2.5-flash-lite",
    messages=[
        {"role": "user", "content": "Hello, how are you?"}
    ]
)

print(response.choices[0].message.content)

Эндпоинты API для Gemini 2.5 Flash Lite

Схемы запроса и ответа повторяют OpenAI — существующие клиенты и SDK работают без изменений.

Chat Completions

Основной эндпоинт: принимает историю сообщений и возвращает ответ модели. Поддерживает потоковый (SSE) и обычный режимы.

POST https://routerai.ru/api/v1/chat/completions
Документация
Authorization
Bearer YOUR_API_KEY
Content-Type
application/json
Model
google/gemini-2.5-flash-lite

Поддерживаемые параметры запроса

Параметр Тип По умолчанию Описание
max_tokens integer — Верхний предел количества токенов, которые модель может сгенерировать в ответе.
temperature float 1 Влияет на разнообразие ответов модели: чем выше, тем более случайным будет вывод.
top_p float 1 Ограничивает выбор модели долей наиболее вероятных токенов: учитываются только токены, чьи вероятности в сумме дают P.
seed integer — Если задан, инференс выполняется детерминированно — повторные запросы с тем же seed и параметрами должны давать одинаковый результат.
response_format map — Заставляет модель выдавать ответ в определённом формате.

Частые вопросы о Gemini 2.5 Flash Lite

Попробуйте Gemini 2.5 Flash Lite

В чате или по API — доступ из России за пару минут, оплата в рублях.

Открыть в чате