Visionsspråk

term_id: vision_language

Category: application_paradigms

Definition

Visionsspråksmodeller, ofta kallade multimodala stora språkmodeller (MLLMs), integrerar datorseende och bearbetning av naturligt språk. De möjliggör för AI att förstå bilder och generera text

Summary

Visionsspråksmodeller är AI-system som bearbetar och korrelerar visuella data med textuell information för att förstå multimodala sammanhang.

Key Concepts

  • Multimodalitet
  • Korsmodal alignering
  • Bildtextning
  • Visuellt frågesvar

Use Cases

  • Automatisk bildtextning
  • System för visuellt frågesvar
  • Innehållsgranskning med kontext