Visjonsspråk

term_id: vision_language

Category: application_paradigms

Definition

Visjonsspråkmodeller, ofte omtalt som multimodale store språkmodeller (MLLMs), integrerer datamaskinvisjon og naturlig språkbehandling. De muliggjør at AI forstår bilder og genererer tekst

Summary

Visjonsspråkmodeller er AI-systemer som behandler og korrelerer visuelle data med tekstinformasjon for å forstå multimodale sammenhenger.

Key Concepts

  • Multimodalitet
  • Kryss-modal tilpasning
  • Bildeteksting (Image Captioning)
  • Visuelt spørsmålsbesvarelse

Use Cases

  • Automatisk bildeteksting
  • Systemer for visuelt spørsmålsbesvarelse
  • Innholdsmoderering med kontekst