Pré-entraînement contrastif langage-image
term_id: contrastive_languageimage_pre_training
Category: training_techniques
Definition
Le pré-entraînement contrastif langage-image (CLIP) est une architecture de réseau neuronal entraînée sur des images et leurs légendes correspondantes issues d’Internet. Il utilise un objectif contrastif pour maximiser la similarité entre les paires image-texte correctes et minimiser celle des paires incorrectes.
Summary
Une méthode de pré-entraînement multimodale qui aligne les représentations d’images et de texte à l’aide de fonctions de perte contrastives.
Key Concepts
- Apprentissage multimodal
- Similarité cosinus
- Classification zero-shot
- Architecture d’encodeur
Use Cases
- Moteurs de recherche d’images
- Guidage de la génération d’images à partir de texte
- Réponse aux questions visuelles