Набор данных: Данные для встраивания / Flickr30K Captions
term_id: datasetembedding_dataflickr30k_captions
Category: training_techniques
Definition
Набор данных Flickr30K Captions — это широко используемый эталонный набор, состоящий из 31 783 изображений, каждое из которых аннотировано пятью различными английскими предложениями, описывающими визуальное содержание. Он служит фундаментальным ресурсом.
Summary
Мультимодальный набор данных, связывающий 31 000 изображений с описаниями, созданными людьми, для обучения кросс-модальных моделей встраивания.
Key Concepts
- Мультимодальное обучение
- Выравнивание изображения и текста
- Кросс-модальный поиск
- Визуальная привязка (Visual Grounding)
Use Cases
- Создание поисковых систем по изображениям
- Генерация описаний изображений
- Обучение моделей «визуальный язык»