Dataset: Inbeddingsdata/Flickr30K Bijschriften

term_id: datasetembedding_dataflickr30k_captions

Category: training_techniques

Definition

Flickr30K Captions is een veelgebruikte benchmarkdataset bestaande uit 31.783 afbeeldingen, elk geannoteerd met vijf verschillende Engelse zinnen die de visuele inhoud beschrijven. Het dient als een fundamentele bron.

Summary

Een multimodale dataset die 31.000 afbeeldingen koppelt aan door mensen gegenereerde bijschriften om cross-modale inbeddingsmodellen te trainen.

Key Concepts

  • Multimodaal leren
  • Afbeelding-tekst alignering
  • Cross-modale opzoeking
  • Visuele grondslag

Use Cases

  • Het bouwen van afbeeldingszoekmachines
  • Het genereren van afbeeldingsbeschrijvingen
  • Het trainen van visie-taalmodellen