Зрительно-языковые модели

term_id: vision_language

Category: application_paradigms

Definition

Зрительно-языковые модели, часто называемые мультимодальными большими языковыми моделями (MLLM), объединяют компьютерное зрение и обработку естественного языка. Они позволяют ИИ понимать изображения и генерировать текст

Summary

Зрительно-языковые модели — это системы ИИ, которые обрабатывают и сопоставляют визуальные данные с текстовой информацией для понимания мультимодального контекста.

Key Concepts

  • Мультимодальность
  • Кросс-модальное выравнивание
  • Генерация подписей к изображениям
  • Ответы на вопросы по изображениям

Use Cases

  • Автоматическая генерация подписей к изображениям
  • Системы ответов на вопросы по визуальным данным
  • Модерация контента с учетом контекста