Adathalmaz: Beágyazási adatok/Flickr30K feliratok
term_id: datasetembedding_dataflickr30k_captions
Category: training_techniques
Definition
A Flickr30K Captions egy széles körben használt benchmark adathalmaz, amely 31 783 képből áll, mindegyikhez öt különböző angol mondat tartozik, amelyek leírják a vizuális tartalmat. Alapvető erőforrásként szolgál.
Summary
Egy multimodális adathalmaz, amely 31 000 képet köt össze emberi által generált feliratokkal a keresztmodális beágyazási modellek tanítása érdekében.
Key Concepts
- Multimodális tanulás
- Kép-szöveg illesztés
- Keresztmodális visszakeresés
- Vizuális alátámasztás (Visual Grounding)
Use Cases
- Képkereső motorok építése
- Képleírások generálása
- Vizuális-nyelvi modellek tanítása