Dataset: Embedding Data/Flickr30K Captions
term_id: datasetembedding_dataflickr30k_captions
Category: training_techniques
Definition
Flickr30K Captions är ett brett använt benchmark-dataset bestående av 31 783 bilder, var och en annoterad med fem distinkta engelska meningar som beskriver det visuella innehållet. Det fungerar som en grundläggande resurs.
Summary
Ett multimodalt dataset som kopplar 31 000 bilder med mänskligt genererade bildtexter för att träna korsmodala embedding-modeller.
Key Concepts
- Multimodal inlärning
- Bild-text-justering
- Korsmodal återvinning
- Visuell grounding
Use Cases
- Byggande av bildsökmotorer
- Generering av bildbeskrivningar
- Träning av vision-språk-modeller