Visionssprog
term_id: vision_language
Category: application_paradigms
Definition
Visionssprogsmodeller, ofte omtalt som multimodale store sprogmodeller (MLLM’er), integrerer computersyn og naturlig sprogbehandling. De gør det muligt for AI at forstå billeder og generere tekst
Summary
Visionssprogsmodeller er AI-systemer, der behandler og korrelerer visuelle data med tekstuel information for at forstå multimodale kontekster.
Key Concepts
- Multimodalitet
- Tværmodal tilpasning
- Billedtekstning
- Visuelt spørgsmålssvar
Use Cases
- Automatiseret billedtekstning
- Systemer til visuelt spørgsmålssvar
- Indholdsmoderation med kontekst