Adathalmaz: Beágyazási adatok/Flickr30K feliratok

term_id: datasetembedding_dataflickr30k_captions

Category: training_techniques

Definition

A Flickr30K Captions egy széles körben használt benchmark adathalmaz, amely 31 783 képből áll, mindegyikhez öt különböző angol mondat tartozik, amelyek leírják a vizuális tartalmat. Alapvető erőforrásként szolgál.

Summary

Egy multimodális adathalmaz, amely 31 000 képet köt össze emberi által generált feliratokkal a keresztmodális beágyazási modellek tanítása érdekében.

Key Concepts

  • Multimodális tanulás
  • Kép-szöveg illesztés
  • Keresztmodális visszakeresés
  • Vizuális alátámasztás (Visual Grounding)

Use Cases

  • Képkereső motorok építése
  • Képleírások generálása
  • Vizuális-nyelvi modellek tanítása