Dataset: Embedding Data/Flickr30K Captions

term_id: datasetembedding_dataflickr30k_captions

Category: training_techniques

Definition

Flickr30K Captions este un set de date benchmark larg utilizat, compus din 31.783 de imagini, fiecare annotată cu cinci propoziții distincte în engleză care descriu conținutul vizual. Servește ca resursă fundamentală.

Summary

Un set de date multimodal care leagă 31.000 de imagini de descrieri generate de oameni pentru antrenarea modelelor de tip embedding cross-modal.

Key Concepts

  • Învățare multimodală
  • Alinierea imagine-text
  • Recuperare cross-modală
  • Ancorare vizuală

Use Cases

  • Construirea motoarelor de căutare imagini
  • Generarea descrierilor imaginilor
  • Antrenarea modelelor viziune-limbaj