Pré-entraînement contrastif langage-image

term_id: contrastive_languageimage_pre_training

Category: training_techniques

Definition

Le pré-entraînement contrastif langage-image (CLIP) est une architecture de réseau neuronal entraînée sur des images et leurs légendes correspondantes issues d’Internet. Il utilise un objectif contrastif pour maximiser la similarité entre les paires image-texte correctes et minimiser celle des paires incorrectes.

Summary

Une méthode de pré-entraînement multimodale qui aligne les représentations d’images et de texte à l’aide de fonctions de perte contrastives.

Key Concepts

  • Apprentissage multimodal
  • Similarité cosinus
  • Classification zero-shot
  • Architecture d’encodeur

Use Cases

  • Moteurs de recherche d’images
  • Guidage de la génération d’images à partir de texte
  • Réponse aux questions visuelles