Zbiór danych: Dane osadzające/Flickr30K Captions

term_id: datasetembedding_dataflickr30k_captions

Category: training_techniques

Definition

Flickr30K Captions to szeroko stosowany zbiór danych referencyjnych składający się z 31 783 obrazów, z których każdy jest opatrzony pięcioma różnymi angielskimi zdaniami opisującymi zawartość wizualną. Stanowi on fundamentalne zasoby (foundational resource).

Summary

Zbiór danych multimodalnych łączący 31 000 obrazów z opisami generowanymi przez ludzi, służący do trenowania modeli osadzających międzymodalnych.

Key Concepts

  • Uczenie multimodalne
  • Dopasowanie obraz-tekst
  • Pobieranie międzymodalne (Cross-Modal Retrieval)
  • Ugruntowanie wizualne (Visual Grounding)

Use Cases

  • Budowanie silników wyszukiwania obrazów
  • Generowanie opisów obrazów
  • Trenowanie modeli językowo-wizualnych