Dataset: Embedding Data/Flickr30K Captions

term_id: datasetembedding_dataflickr30k_captions

Category: training_techniques

Definition

Flickr30K Captions är ett brett använt benchmark-dataset bestående av 31 783 bilder, var och en annoterad med fem distinkta engelska meningar som beskriver det visuella innehållet. Det fungerar som en grundläggande resurs.

Summary

Ett multimodalt dataset som kopplar 31 000 bilder med mänskligt genererade bildtexter för att träna korsmodala embedding-modeller.

Key Concepts

  • Multimodal inlärning
  • Bild-text-justering
  • Korsmodal återvinning
  • Visuell grounding

Use Cases

  • Byggande av bildsökmotorer
  • Generering av bildbeskrivningar
  • Träning av vision-språk-modeller