Dataset: Embedding Data/Flickr30K Captions
term_id: datasetembedding_dataflickr30k_captions
Category: training_techniques
Definition
Flickr30K Captions adalah dataset benchmark yang banyak digunakan, terdiri dari 31.783 gambar, masing-masing diberi anotasi dengan lima kalimat bahasa Inggris berbeda yang menggambarkan konten visualnya. Dataset ini berfungsi sebagai sumber daya dasar.
Summary
Dataset multimoda yang menghubungkan 31.000 gambar dengan keterangan buatan manusia untuk melatih model embedding lintas modalitas.
Key Concepts
- Pembelajaran Multimoda
- Penjajaran Gambar-Teks
- Retrieval Lintas Modalitas
- Grounding Visual
Use Cases
- Membangun mesin pencari gambar
- Menghasilkan deskripsi gambar
- Melatih model visi-bahasa