Kontrastives Vorabtraining von Sprache und Bild
term_id: contrastive_languageimage_pre_training
Category: training_techniques
Definition
Kontrastives Vorabtraining von Sprache und Bild (CLIP) ist eine neuronale Netzwerkarchitektur, die mit Bildern und deren entsprechenden Beschreibungen aus dem Internet trainiert wird. Sie nutzt ein kontrastives Ziel, um die Ähnlichkeit zwischen passenden Bild-Text-Paaren zu maximieren.
Summary
Eine multimodale Vorabtrainingsmethode, die Bild- und Textdarstellungen durch kontrastive Verlustfunktionen aufeinander abstimmt.
Key Concepts
- Multimodales Lernen
- Kosinusähnlichkeit
- Zero-Shot-Klassifizierung
- Encoder-Architektur
Use Cases
- Bildersuchmaschinen
- Steuerung der Text-zu-Bild-Generierung
- Visuelle Fragenbeantwortung