Набор данных: Данные для встраивания / Flickr30K Captions

term_id: datasetembedding_dataflickr30k_captions

Category: training_techniques

Definition

Набор данных Flickr30K Captions — это широко используемый эталонный набор, состоящий из 31 783 изображений, каждое из которых аннотировано пятью различными английскими предложениями, описывающими визуальное содержание. Он служит фундаментальным ресурсом.

Summary

Мультимодальный набор данных, связывающий 31 000 изображений с описаниями, созданными людьми, для обучения кросс-модальных моделей встраивания.

Key Concepts

  • Мультимодальное обучение
  • Выравнивание изображения и текста
  • Кросс-модальный поиск
  • Визуальная привязка (Visual Grounding)

Use Cases

  • Создание поисковых систем по изображениям
  • Генерация описаний изображений
  • Обучение моделей «визуальный язык»