Dataset: Embedding Data/Flickr30K Captions

term_id: datasetembedding_dataflickr30k_captions

Category: training_techniques

Definition

Flickr30K Captions adalah dataset benchmark yang banyak digunakan, terdiri dari 31.783 gambar, masing-masing diberi anotasi dengan lima kalimat bahasa Inggris berbeda yang menggambarkan konten visualnya. Dataset ini berfungsi sebagai sumber daya dasar.

Summary

Dataset multimoda yang menghubungkan 31.000 gambar dengan keterangan buatan manusia untuk melatih model embedding lintas modalitas.

Key Concepts

  • Pembelajaran Multimoda
  • Penjajaran Gambar-Teks
  • Retrieval Lintas Modalitas
  • Grounding Visual

Use Cases

  • Membangun mesin pencari gambar
  • Menghasilkan deskripsi gambar
  • Melatih model visi-bahasa