Zbiór danych: Dane osadzające/Flickr30K Captions
term_id: datasetembedding_dataflickr30k_captions
Category: training_techniques
Definition
Flickr30K Captions to szeroko stosowany zbiór danych referencyjnych składający się z 31 783 obrazów, z których każdy jest opatrzony pięcioma różnymi angielskimi zdaniami opisującymi zawartość wizualną. Stanowi on fundamentalne zasoby (foundational resource).
Summary
Zbiór danych multimodalnych łączący 31 000 obrazów z opisami generowanymi przez ludzi, służący do trenowania modeli osadzających międzymodalnych.
Key Concepts
- Uczenie multimodalne
- Dopasowanie obraz-tekst
- Pobieranie międzymodalne (Cross-Modal Retrieval)
- Ugruntowanie wizualne (Visual Grounding)
Use Cases
- Budowanie silników wyszukiwania obrazów
- Generowanie opisów obrazów
- Trenowanie modeli językowo-wizualnych