Jazyk a vize (Vision-Language)
term_id: vision_language
Category: application_paradigms
Definition
Modely jazyka a vize, často označované jako multimodální velké jazykové modely (MLLM), integrují počítačové vidění a zpracování přirozeného jazyka. Umožňují AI chápat obrázky a generovat text
Summary
Modely jazyka a vize jsou systémy AI, které zpracovávají a korelují vizuální data s textovými informacemi za účelem pochopení multimodálních kontextů.
Key Concepts
- Multimodalita
- Napříčmodální zarovnání
- Popisování obrázků
- Odpovídání na otázky založené na obrazech
Use Cases
- Automatické popisování obrázků
- Systémy pro odpovídání na otázky založené na obrazech
- Moderace obsahu s kontextem