Tập dữ liệu: Dữ liệu Nhúng/Flickr30K Captions
term_id: datasetembedding_dataflickr30k_captions
Category: training_techniques
Definition
Flickr30K Captions là một tập dữ liệu chuẩn mực được sử dụng rộng rãi, bao gồm 31.783 hình ảnh, mỗi hình được chú thích bằng năm câu tiếng Anh riêng biệt mô tả nội dung trực quan. Đây là nguồn tài nguyên nền tảng.
Summary
Một tập dữ liệu đa phương thức liên kết 31.000 hình ảnh với các chú thích do con người tạo ra để huấn luyện các mô hình nhúng xuyên phương thức.
Key Concepts
- Học đa phương thức
- Căn chỉnh Hình ảnh-Văn bản
- Tìm kiếm xuyên phương thức
- Định vị trực quan
Use Cases
- Xây dựng công cụ tìm kiếm hình ảnh
- Tạo mô tả hình ảnh
- Huấn luyện các mô hình ngôn ngữ-hình ảnh