Скопировано!
Perceptron Mk1 (Mark One) является высококачественной моделью Perceptron для работы с видео и воплощенного рассуждения в формате “зрение-язык”. Она принимает изображения и видеоматериалы в паре с запросами на естественном языке и выдает подробные ответы на визуальное понимание, как в структурированном, так и в естественном языке. Модель превосходно справляется с задачами понимания видео, такими как вопросы и ответы по видео, суммаризация и обнаружение событий. На входах с изображениями она продвигает привязку по примеру из мультимодальных подсказок, распознавание текста и разбор документов на сложных реальных данных, обнаружение и подсчет объектов с открытым словарем, а также оценку позы рук.
Рассуждение может быть включено по запросу для обмена задержкой на более глубокий анализ сложных задач. Структурированные аннотации выдаются в тексте только при явном запросе через параметр annotation_format (передайте "point", "box" или "polygon" для пространственной локализации на изображениях, или "clip" (начало/конец временных меток) для временных сегментов в видео). Без annotation_format модель возвращает только текст на естественном языке.