Visionssprog

term_id: vision_language

Category: application_paradigms

Definition

Visionssprogsmodeller, ofte omtalt som multimodale store sprogmodeller (MLLM’er), integrerer computersyn og naturlig sprogbehandling. De gør det muligt for AI at forstå billeder og generere tekst

Summary

Visionssprogsmodeller er AI-systemer, der behandler og korrelerer visuelle data med tekstuel information for at forstå multimodale kontekster.

Key Concepts

  • Multimodalitet
  • Tværmodal tilpasning
  • Billedtekstning
  • Visuelt spørgsmålssvar

Use Cases

  • Automatiseret billedtekstning
  • Systemer til visuelt spørgsmålssvar
  • Indholdsmoderation med kontekst