Visjonsspråk
term_id: vision_language
Category: application_paradigms
Definition
Visjonsspråkmodeller, ofte omtalt som multimodale store språkmodeller (MLLMs), integrerer datamaskinvisjon og naturlig språkbehandling. De muliggjør at AI forstår bilder og genererer tekst
Summary
Visjonsspråkmodeller er AI-systemer som behandler og korrelerer visuelle data med tekstinformasjon for å forstå multimodale sammenhenger.
Key Concepts
- Multimodalitet
- Kryss-modal tilpasning
- Bildeteksting (Image Captioning)
- Visuelt spørsmålsbesvarelse
Use Cases
- Automatisk bildeteksting
- Systemer for visuelt spørsmålsbesvarelse
- Innholdsmoderering med kontekst