Загрузка...

Qwen2.5-VL 7B Instruct

Разработчик: Qwen
Идентификатор:
Скопировано!

Модель недоступна с

Ни один провайдер больше не обслуживает Qwen2.5-VL 7B Instruct, поэтому запросы к ней через API RouterAI не выполняются, а цены не показываются. Если провайдер появится снова, модель вернётся в каталог автоматически. Пока можно выбрать другую модель в каталоге.

Характеристики Qwen2.5-VL 7B Instruct

Контекстное окно 33K

Дата релиза 28 августа 2024

Мультимодальность

Входящие данные:

  • Текст
  • Изображения

Исходящие данные:

  • Текст

Что умеет Qwen2.5-VL 7B Instruct

Qwen2.5 VL 7B — это мультимодальная LLM от команды Qwen с следующими ключевыми улучшениями:

  • Передовое понимание изображений различного разрешения и соотношения сторон: Qwen2.5-VL достигает передовых результатов в тестах на визуальное понимание, включая MathVista, DocVQA, RealWorldQA, MTVQA и другие.

  • Понимание видео длительностью более 20 минут: Qwen2.5-VL может понимать видео продолжительностью более 20 минут для высококачественного ответа на вопросы, основанные на видео, диалогов, создания контента и т.д.

  • Агент, который может управлять вашими мобильными устройствами, роботами и т.д.: благодаря способностям к сложным рассуждениям и принятию решений, Qwen2.5-VL может быть интегрирован с устройствами, такими как мобильные телефоны, роботы и т.д., для автоматической работы на основе визуальной среды и текстовых инструкций.

  • Поддержка нескольких языков: для обслуживания глобальных пользователей, помимо английского и китайского, Qwen2.5-VL теперь поддерживает понимание текстов на разных языках внутри изображений, включая большинство европейских языков, японский, корейский, арабский, вьетнамский и другие.

Для получения более подробной информации смотрите этот пост в блоге и репозиторий на GitHub.

Использование этой модели регулируется ЛИЦЕНЗИОННЫМ СОГЛАШЕНИЕМ Tongyi Qianwen.