Jazyk a vize (Vision-Language)

term_id: vision_language

Category: application_paradigms

Definition

Modely jazyka a vize, často označované jako multimodální velké jazykové modely (MLLM), integrují počítačové vidění a zpracování přirozeného jazyka. Umožňují AI chápat obrázky a generovat text

Summary

Modely jazyka a vize jsou systémy AI, které zpracovávají a korelují vizuální data s textovými informacemi za účelem pochopení multimodálních kontextů.

Key Concepts

  • Multimodalita
  • Napříčmodální zarovnání
  • Popisování obrázků
  • Odpovídání na otázky založené na obrazech

Use Cases

  • Automatické popisování obrázků
  • Systémy pro odpovídání na otázky založené na obrazech
  • Moderace obsahu s kontextem