Contrastieve vooropleiding van taal-afbeeldingen
term_id: contrastive_languageimage_pre_training
Category: training_techniques
Definition
Contrastieve taal-afbeelding vooropleiding (CLIP) is een neurale netwerkarchitectuur die is getraind op afbeeldingen en de bijbehorende bijschriften van internet. Het gebruikt een contrastief doel om de overeenkomst tussen afbeeldingen en tekst te maximaliseren, waardoor het model in staat is om afbeeldingen te classificeren op basis van tekstbeschrijvingen zonder specifieke training voor die taak.
Summary
Een multimodale voortrainingsmethode die beeld- en tekstrepresentaties uitlijnt met behulp van contrastieve verliesfuncties.
Key Concepts
- Multimodaal leren
- Cosinus-ähnlichkeit
- Zero-shot classificatie
- Encoder-architectuur
Use Cases
- Afbeeldingszoekmachines
- Sturing van tekst-naar-afbeeldingsgeneratie
- Visueel vragen beantwoorden