Limba vizuală

term_id: vision_language

Category: application_paradigms

Definition

Modelele de limbă vizuală, adesea referite ca Modele Linguistice Mari Multimodale (MLLMs), integrează viziunea pe calculator și procesarea limbajului natural. Ele permit AI să înțeleagă imaginile și să genereze text

Summary

Modelele de limbă vizuală sunt sisteme AI care procesează și corelează datele vizuale cu informațiile textuale pentru a înțelege contexte multimodale.

Key Concepts

  • Multimodalitate
  • Aliniere transmodală
  • Descrierea imaginilor
  • Răspunsul la întrebări vizuale

Use Cases

  • Generarea automată de descrieri pentru imagini
  • Sisteme de răspuns la întrebări vizuale
  • Moderarea conținutului cu context