Tập dữ liệu: Dữ liệu Nhúng/Flickr30K Captions

term_id: datasetembedding_dataflickr30k_captions

Category: training_techniques

Definition

Flickr30K Captions là một tập dữ liệu chuẩn mực được sử dụng rộng rãi, bao gồm 31.783 hình ảnh, mỗi hình được chú thích bằng năm câu tiếng Anh riêng biệt mô tả nội dung trực quan. Đây là nguồn tài nguyên nền tảng.

Summary

Một tập dữ liệu đa phương thức liên kết 31.000 hình ảnh với các chú thích do con người tạo ra để huấn luyện các mô hình nhúng xuyên phương thức.

Key Concepts

  • Học đa phương thức
  • Căn chỉnh Hình ảnh-Văn bản
  • Tìm kiếm xuyên phương thức
  • Định vị trực quan

Use Cases

  • Xây dựng công cụ tìm kiếm hình ảnh
  • Tạo mô tả hình ảnh
  • Huấn luyện các mô hình ngôn ngữ-hình ảnh