Görsel Metinden Metne
term_id: image_text_to_text
Category: application_paradigms
Definition
Görsel Metinden Metne, görsel girdileri metinsel sorgularla birlikte işleyerek tutarlı doğal dil çıktılarını üreten modelleri ifade eder. Bu sistemler genellikle Görüş-Dil Modelleri (VLMs) olarak adlandırılır ve görsel ile dil bilgilerini birleştirir.
Summary
Girdi görsellerine ve isteğe bağlı metin istemlerine dayanarak metinsel açıklamalar veya yanıtlar üreten çok modlu bir yapay zeka yeteneği.
Key Concepts
- Çok Modlu Öğrenme
- Görsel Soru Cevaplama
- Altyazı Oluşturma
- Çapraz Modlu Dikkat
Use Cases
- Erişilebilirlik için otomatik görsel altyazı oluşturma
- Görsel soru-cevap sistemleri
- İçerik denetimi analizi