Dataset: Embedding Data/Flickr30K Captions
term_id: datasetembedding_dataflickr30k_captions
Category: training_techniques
Definition
Flickr30K Captions er et mye brukt benchmark-datasett som består av 31 783 bilder, der hvert bilde er annotert med fem ulike engelske setninger som beskriver det visuelle innholdet. Det fungerer som en grunnleggende ressurs.
Summary
Et multimodalt datasett som kobler 31 000 bilder med menneskegenererte bildetekster for å trene tverrmodale innbæringmodeller.
Key Concepts
- Multimodal læring
- Bilde-tekst-tilpasning
- Tverrmodal henting
- Visuell forankring
Use Cases
- Bygging av bildesøkemotorer
- Generering av bildetekster
- Trening av visjon-språk-modeller