Limba vizuală
term_id: vision_language
Category: application_paradigms
Definition
Modelele de limbă vizuală, adesea referite ca Modele Linguistice Mari Multimodale (MLLMs), integrează viziunea pe calculator și procesarea limbajului natural. Ele permit AI să înțeleagă imaginile și să genereze text
Summary
Modelele de limbă vizuală sunt sisteme AI care procesează și corelează datele vizuale cu informațiile textuale pentru a înțelege contexte multimodale.
Key Concepts
- Multimodalitate
- Aliniere transmodală
- Descrierea imaginilor
- Răspunsul la întrebări vizuale
Use Cases
- Generarea automată de descrieri pentru imagini
- Sisteme de răspuns la întrebări vizuale
- Moderarea conținutului cu context