Visionsspråk
term_id: vision_language
Category: application_paradigms
Definition
Visionsspråksmodeller, ofta kallade multimodala stora språkmodeller (MLLMs), integrerar datorseende och bearbetning av naturligt språk. De möjliggör för AI att förstå bilder och generera text
Summary
Visionsspråksmodeller är AI-system som bearbetar och korrelerar visuella data med textuell information för att förstå multimodala sammanhang.
Key Concepts
- Multimodalitet
- Korsmodal alignering
- Bildtextning
- Visuellt frågesvar
Use Cases
- Automatisk bildtextning
- System för visuellt frågesvar
- Innehållsgranskning med kontext