Загрузка...

Каталог AI моделей и нейросетей: сравнение и цены

Каталог нейросетей с описанием возможностей и ценами в рублях. Сравните стоимость токенов и выберите лучшее решение.

  • Логотип Heygen

    Avatar IV

    Heygen
    Скопировано!

    HeyGen: Avatar IV — это модель преобразования изображения в видео, которая анимирует одну фотографию в выразительное видео говорящей головы с синхронизацией губ. Вместо того чтобы просто сопоставлять формы рта со словами, она интерпретирует вокал…

    Входные данные:
    • Текст
    • Изображения
    • Аудио
    Исходящие данные:
    • Видео
  • Muse Spark 1.2 Contributor

    Meta
    Скопировано!

    Muse Spark 1.2 contributor tier — это модель рассуждений от Meta, предназначенная для разработчиков, которые хотят начать разработку с еще более низкими затратами. Она значительно дешевле, чем Muse Spark 1.2. Ваши запросы и результаты могут использоваться для улучшения продуктов Meta, что делает ее подходящей для экспериментов, обучения и начальных проектов без беспокойства о расходах.

    Это модель рассуждений от Meta, адаптированная для сложных агентных задач. Она принимает текст, изображения, видео, аудио и PDF-документы, возвращает текст и предлагает контекстное окно на 1 миллион токенов. Модель разработана для поддержки многопоточных рабочих процессов, будь то в качестве основного агента, который планирует и делегирует, или в качестве подагента, выполняющего задачи параллельно. Она работает с различными кодовыми оболочками и поддерживает структурированный вывод, параллельный вызов функций и настраиваемую степень рассуждений. В тестах Meta она показывает хорошие результаты при рефакторинге нескольких файлов, расширенных сеансах отладки, генерации целых репозиториев и задачах, которые выходят за рамки одного запроса.

    Входные данные:
    • Текст
    • Изображения
    • Видео
    • Файл
    • Аудио
    Исходящие данные:
    • Текст
  • Логотип DeepSeek

    DeepSeek V4 Flash Vision Exp

    DeepSeek
    Скопировано!

    DeepSeek V4 Flash Vision Exp — это экспериментальная версия DeepSeek с поддержкой визуального восприятия, добавляющая понимание изображений при сохранении возможностей базовой модели в области работы с текстом, включая агентов, рассуждения и знания о мире. Это разреженная модель с использованием смеси экспертов, имеющая 13 миллиардов активных параметров из общего числа в 284 миллиарда.

    Она подходит для понимания документов и диаграмм, визуального ответа на вопросы и мультимодальных рабочих процессов агентов, которые чередуют текст и изображения.

    Входные данные:
    • Текст
    • Изображения
    Исходящие данные:
    • Текст
  • Логотип Tencent

    Hy-MT2-1.8B

    Tencent
    Скопировано!

    Hy-MT2-1.8B — это компактная модель перевода с 1.8 миллиардами параметров от Tencent. Она поддерживает 33 языковые пары и пять пар китайских диалектов и языков меньшинств, с рабочими процессами для структурированного, основанного на разделителях, контекстного, основанного на глоссарии и стилистически направленного перевода.

    Входные данные:
    • Текст
    Исходящие данные:
    • Текст
  • Логотип Tencent

    Hy-MT2-30B-A3B

    Tencent
    Скопировано!

    Hy-MT2-30B-A3B — это флагманская модель перевода Tencent в семействе Hy-MT2. Она поддерживает 33 языковые пары и пять пар китайских диалектов и языков меньшинств, с рабочими процессами для структурированного, основанного на разделителях, контекстного, основанного на глоссарии и стилизованного перевода. Она использует 3 миллиарда активных параметров из 30 миллиардов общих.

    Входные данные:
    • Текст
    Исходящие данные:
    • Текст
  • Логотип Black-forest-labs

    FLUX Video Upscale

    Black-forest-labs
    Скопировано!

    FLUX Video Upscale — это модель увеличения разрешения видео от Black Forest Labs. Она увеличивает исходное видео в 1,5–3 раза, сохраняя его продолжительность, с возможностью использования дополнительного запроса…

    Входные данные:
    • Текст
    • Видео
    Исходящие данные:
    • Видео
  • Логотип Tencent

    Hy-MT2-7B

    Tencent
    Скопировано!

    Hy-MT2-7B — это модель перевода с 7 миллиардами параметров от Tencent. Она поддерживает 33 языковые пары и пять пар китайских диалектов и языков меньшинств, с рабочими процессами для структурированного, основанного на разделителях, контекстного, основанного на глоссарии и стилизованного перевода.

    Входные данные:
    • Текст
    Исходящие данные:
    • Текст
  • Логотип Z AI

    GLM Latest

    Z AI алиас
    Скопировано!

    GLM-5.3 — это крупномасштабная модель рассуждений от Z.ai, созданная для сложных задач в области программной инженерии и задач агентов с длительным горизонтом. Она поддерживает ввод и вывод текста с контекстным окном в 1 миллион токенов и улучшает GLM-5.2 в кодировании и в балансе между производительностью и эффективностью использования токенов.

    Режим рассуждений всегда включен и не может быть отключен. Поддерживаются усилия рассуждений low, high и max; по умолчанию используется max.

    Входные данные:
    • Текст
    Исходящие данные:
    • Текст
  • Логотип Z AI

    GLM 5.3

    Z AI
    Скопировано!

    GLM-5.3 — это крупномасштабная модель рассуждений от Z.ai, созданная для сложных задач в области программной инженерии и задач агентов с длительным горизонтом. Она поддерживает ввод и вывод текста с контекстным окном в 1 миллион токенов и улучшает GLM-5.2 в кодировании и в балансе между производительностью и эффективностью использования токенов.

    Режим рассуждений всегда включен и не может быть отключен. Поддерживаются усилия рассуждений low, high и max; по умолчанию используется max.

    Входные данные:
    • Текст
    Исходящие данные:
    • Текст
  • Логотип Qwen

    Qwen3.8 27B

    Qwen
    Скопировано!

    Qwen3.8 27B — это модель с плотной архитектурой для обработки изображений и текста от Qwen. Она подходит для программирования, профессиональных рабочих процессов, исследований, мультимодального взаимодействия и длительных задач агентов, с возможностью включения или отключения гибкого мышления.

    Входные данные:
    • Текст
    • Изображения
    • Видео
    Исходящие данные:
    • Текст
  • Логотип NVIDIA

    Nemotron 3.5 ASR Streaming Multilingual 0.6B

    NVIDIA
    Скопировано!

    Nemotron 3.5 ASR Streaming Multilingual 0.6B — это модель распознавания речи от NVIDIA. Ее конструкция FastConformer-RNNT, учитывающая условия запроса и кэш, ориентирована на низкую задержку транскрипции более чем на 40 языках для создания субтитров в реальном времени, голосовых агентов и многоязычных транскрипционных конвейеров.

    Входные данные:
    • Аудио
    Исходящие данные:
    • Транскрибация
  • Логотип Mistral AI

    Voxtral Small 24B 2507 STT

    Mistral AI
    Скопировано!

    Voxtral Small 24B 2507 STT — это модель для транскрипции речи от Mistral AI. Она подходит для задач транскрипции, перевода и аудиоанализа, которые выигрывают от ее большей емкости модели.

    Входные данные:
    • Аудио
    Исходящие данные:
    • Транскрибация
  • Логотип Mistral AI

    Voxtral Mini 3B 2507

    Mistral AI
    Скопировано!

    Voxtral Mini 3B 2507 — это модель для понимания речи и аудио от Mistral AI. Она подходит для транскрипции, перевода и компактной обработки аудио.

    Входные данные:
    • Аудио
    Исходящие данные:
    • Транскрибация
  • Логотип Bytedance-seed

    Seedream 5.0 Lite

    Bytedance-seed
    Скопировано!

    Seedream 5.0 Lite — это модель генерации изображений от ByteDance Seed. Она подходит для профессионального визуального творчества, которое выигрывает от подключения к интернету для поиска, понимания сложных запросов, визуальных ссылок и обширных знаний…

    Входные данные:
    • Текст
    • Изображения
    Исходящие данные:
    • Изображения
  • Логотип Google

    Gemini 3.7 Flash

    Google
    Скопировано!

    Gemini 3.7 Flash — это мультимодальная модель от Google для быстрых агентных рабочих процессов, программирования и сложных многошаговых рассуждений. Она разработана для задач, требующих оперативной производительности и надежного многошагового решения проблем.

    Входные данные:
    • Текст
    • Изображения
    • Видео
    • Файл
    • Аудио
    Исходящие данные:
    • Текст