Dataset: Embedding Data/Flickr30K Captions
term_id: datasetembedding_dataflickr30k_captions
Category: training_techniques
Definition
Flickr30K Captions este un set de date benchmark larg utilizat, compus din 31.783 de imagini, fiecare annotată cu cinci propoziții distincte în engleză care descriu conținutul vizual. Servește ca resursă fundamentală.
Summary
Un set de date multimodal care leagă 31.000 de imagini de descrieri generate de oameni pentru antrenarea modelelor de tip embedding cross-modal.
Key Concepts
- Învățare multimodală
- Alinierea imagine-text
- Recuperare cross-modală
- Ancorare vizuală
Use Cases
- Construirea motoarelor de căutare imagini
- Generarea descrierilor imaginilor
- Antrenarea modelelor viziune-limbaj