Datasæt: Indlejringsdata/Flickr30K-billedtekster

term_id: datasetembedding_dataflickr30k_captions

Category: training_techniques

Definition

Flickr30K-billedtekster er et bredt anvendt benchmark-datasæt, der omfatter 31.783 billeder, hvoraf hvert er annoteret med fem forskellige engelske sætninger, der beskriver det visuelle indhold. Det fungerer som en grundlæggende ressource

Summary

Et multimodalt datasæt, der kobler 31.000 billeder med menneskegenererede billedtekster for at træne tværmodale indlejringsmodeller.

Key Concepts

  • Multimodal læring
  • Billede-tekst-alignering
  • Tværmodal hentning
  • Visuel forankring

Use Cases

  • Udvikling af billedsøgemaskiner
  • Generering af billedbeskrivelser
  • Træning af vision-sprog-modeller