Dataset: Inbeddingsdata/Flickr30K Bijschriften
term_id: datasetembedding_dataflickr30k_captions
Category: training_techniques
Definition
Flickr30K Captions is een veelgebruikte benchmarkdataset bestaande uit 31.783 afbeeldingen, elk geannoteerd met vijf verschillende Engelse zinnen die de visuele inhoud beschrijven. Het dient als een fundamentele bron.
Summary
Een multimodale dataset die 31.000 afbeeldingen koppelt aan door mensen gegenereerde bijschriften om cross-modale inbeddingsmodellen te trainen.
Key Concepts
- Multimodaal leren
- Afbeelding-tekst alignering
- Cross-modale opzoeking
- Visuele grondslag
Use Cases
- Het bouwen van afbeeldingszoekmachines
- Het genereren van afbeeldingsbeschrijvingen
- Het trainen van visie-taalmodellen