Contrastieve vooropleiding van taal-afbeeldingen

term_id: contrastive_languageimage_pre_training

Category: training_techniques

Definition

Contrastieve taal-afbeelding vooropleiding (CLIP) is een neurale netwerkarchitectuur die is getraind op afbeeldingen en de bijbehorende bijschriften van internet. Het gebruikt een contrastief doel om de overeenkomst tussen afbeeldingen en tekst te maximaliseren, waardoor het model in staat is om afbeeldingen te classificeren op basis van tekstbeschrijvingen zonder specifieke training voor die taak.

Summary

Een multimodale voortrainingsmethode die beeld- en tekstrepresentaties uitlijnt met behulp van contrastieve verliesfuncties.

Key Concepts

  • Multimodaal leren
  • Cosinus-ähnlichkeit
  • Zero-shot classificatie
  • Encoder-architectuur

Use Cases

  • Afbeeldingszoekmachines
  • Sturing van tekst-naar-afbeeldingsgeneratie
  • Visueel vragen beantwoorden