Datasæt: Indlejringsdata/Flickr30K-billedtekster
term_id: datasetembedding_dataflickr30k_captions
Category: training_techniques
Definition
Flickr30K-billedtekster er et bredt anvendt benchmark-datasæt, der omfatter 31.783 billeder, hvoraf hvert er annoteret med fem forskellige engelske sætninger, der beskriver det visuelle indhold. Det fungerer som en grundlæggende ressource
Summary
Et multimodalt datasæt, der kobler 31.000 billeder med menneskegenererede billedtekster for at træne tværmodale indlejringsmodeller.
Key Concepts
- Multimodal læring
- Billede-tekst-alignering
- Tværmodal hentning
- Visuel forankring
Use Cases
- Udvikling af billedsøgemaskiner
- Generering af billedbeskrivelser
- Træning af vision-sprog-modeller