Dataset: Embedding Data/Flickr30K Captions

term_id: datasetembedding_dataflickr30k_captions

Category: training_techniques

Definition

Flickr30K Captions er et mye brukt benchmark-datasett som består av 31 783 bilder, der hvert bilde er annotert med fem ulike engelske setninger som beskriver det visuelle innholdet. Det fungerer som en grunnleggende ressurs.

Summary

Et multimodalt datasett som kobler 31 000 bilder med menneskegenererte bildetekster for å trene tverrmodale innbæringmodeller.

Key Concepts

  • Multimodal læring
  • Bilde-tekst-tilpasning
  • Tverrmodal henting
  • Visuell forankring

Use Cases

  • Bygging av bildesøkemotorer
  • Generering av bildetekster
  • Trening av visjon-språk-modeller