Зрительно-языковые модели
term_id: vision_language
Category: application_paradigms
Definition
Зрительно-языковые модели, часто называемые мультимодальными большими языковыми моделями (MLLM), объединяют компьютерное зрение и обработку естественного языка. Они позволяют ИИ понимать изображения и генерировать текст
Summary
Зрительно-языковые модели — это системы ИИ, которые обрабатывают и сопоставляют визуальные данные с текстовой информацией для понимания мультимодального контекста.
Key Concepts
- Мультимодальность
- Кросс-модальное выравнивание
- Генерация подписей к изображениям
- Ответы на вопросы по изображениям
Use Cases
- Автоматическая генерация подписей к изображениям
- Системы ответов на вопросы по визуальным данным
- Модерация контента с учетом контекста