Model wizyjno-językowy
term_id: vision_language
Category: application_paradigms
Definition
Modele wizyjno-językowe, często określane jako Wielomodalne Duże Modele Językowe (MLLMs), integrują widzenie komputerowe z przetwarzaniem języka naturalnego. Umożliwiają AI rozumienie obrazów i generowanie tekstu na ich podstawie.
Summary
Modele wizyjno-językowe to systemy AI przetwarzające i korelujące dane wizualne z informacją tekstową, aby zrozumieć kontekst multimodalny.
Key Concepts
- Wielomodowość
- Wyrównanie międzymodalne
- Opisywanie obrazów
- Odpowiadanie na pytania wizualne
Use Cases
- Automatyczne opisywanie obrazów
- Systemy odpowiadania na pytania wizualne
- Moderacja treści z uwzględnieniem kontekstu wizualnego