Kontrastives Vorabtraining von Sprache und Bild

term_id: contrastive_languageimage_pre_training

Category: training_techniques

Definition

Kontrastives Vorabtraining von Sprache und Bild (CLIP) ist eine neuronale Netzwerkarchitektur, die mit Bildern und deren entsprechenden Beschreibungen aus dem Internet trainiert wird. Sie nutzt ein kontrastives Ziel, um die Ähnlichkeit zwischen passenden Bild-Text-Paaren zu maximieren.

Summary

Eine multimodale Vorabtrainingsmethode, die Bild- und Textdarstellungen durch kontrastive Verlustfunktionen aufeinander abstimmt.

Key Concepts

  • Multimodales Lernen
  • Kosinusähnlichkeit
  • Zero-Shot-Klassifizierung
  • Encoder-Architektur

Use Cases

  • Bildersuchmaschinen
  • Steuerung der Text-zu-Bild-Generierung
  • Visuelle Fragenbeantwortung