Gambar Teks ke Teks

term_id: image_text_to_text

Category: application_paradigms

Definition

Gambar Teks ke Teks merujuk pada model yang memproses input visual bersama dengan kueri tekstual untuk menghasilkan output bahasa alami yang koheren. Sistem ini, yang sering disebut sebagai Model Bahasa-Visual (VLM), menggabungkan pemahaman visual dan linguistik untuk memberikan konteks yang kaya.

Summary

Kemampuan AI multimodal yang menghasilkan deskripsi teks atau jawaban berdasarkan gambar input dan prompt teks opsional.

Key Concepts

  • Pembelajaran Multimodal
  • Jawaban Pertanyaan Visual
  • Penulisan Keterangan Gambar
  • Perhatian Lintas-Modal

Use Cases

  • Penulisan keterangan gambar otomatis untuk aksesibilitas
  • Sistem jawaban pertanyaan visual
  • Analisis moderasi konten