Bahasa Penglihatan (Vision-Language)
term_id: vision_language
Category: application_paradigms
Definition
Model Bahasa-Penglihatan, yang sering disebut sebagai Model Bahasa Besar Multimodal (MLLMs), mengintegrasikan penglihatan komputer dan pemrosesan bahasa alami. Model ini memungkinkan AI untuk memahami gambar dan menghasilkan teks
Summary
Model Bahasa-Penglihatan adalah sistem AI yang memproses dan mengorelasikan data visual dengan informasi teks untuk memahami konteks multimodal.
Key Concepts
- Multimodalitas
- Penjajaran Lintas-Modal
- Penulisan Keterangan Gambar (Image Captioning)
- Pertanyaan Jawaban Visual
Use Cases
- Penulisan keterangan gambar otomatis
- Sistem pertanyaan jawaban visual
- Moderasi konten dengan konteks