データセット:埋め込みデータ/Flickr30Kキャプション

term_id: datasetembedding_dataflickr30k_captions

Category: training_techniques

Definition

Flickr30Kキャプションは、視覚的内容を記述する5つの異なる英語文で注釈付けされた3万1,783枚の画像からなる、広く使用されているベンチマークデータセットです。これは基盤的なリソースとして機能します。

Summary

3万1千枚の画像と人間が生成した説明文を結びつけ、クロスモーダル埋め込みモデルを訓練するためのマルチモーダルデータセット。

Key Concepts

  • マルチモーダル学習
  • 画像-テキスト整合
  • クロスモーダル検索
  • ビジュアルグラウンディング

Use Cases

  • 画像検索エンジンの構築
  • 画像説明文の生成
  • ビジョン言語モデルの訓練