対照的言語-画像事前学習

term_id: contrastive_languageimage_pre_training

Category: training_techniques

Definition

対照的言語-画像事前学習(CLIP)は、インターネット上の画像とそれに対応するキャプションで訓練されたニューラルネットワークアーキテクチャです。これは、画像とテキストの埋め込み空間における一致度を最大化し、不一致を最小化する対照的目的関数を使用します。

Summary

対照的損失関数を使用して画像とテキストの表現を整合させるマルチモーダル事前学習手法。

Key Concepts

  • マルチモーダル学習
  • コサイン類似度
  • ゼロショット分類
  • エンコーダアーキテクチャ

Use Cases

  • 画像検索エンジン
  • テキストから画像への生成ガイダンス
  • 視覚質問応答(VQA)