Antrenament Precoce Contrastiv Limbaj-Imagine
term_id: contrastive_languageimage_pre_training
Category: training_techniques
Definition
Antrenamentul precoce contrastiv limbaj-imagine (CLIP) este o arhitectură de rețea neuronală antrenată pe imagini și legendile lor corespunzătoare, preluate de pe internet. Utilizează un obiectiv contrastiv pentru a maximiza similitudinea dintre perechile imagine-text corelate și a minimiza cea dintre cele necorelate.
Summary
O metodă de antrenament preliminar multimodal care aliniază reprezentările imaginilor și textului folosind funcții de pierdere contrastivă.
Key Concepts
- Învățare Multimodală
- Similitudine Cosinus
- Clasificare Zero-shot
- Arhitectură Encoder
Use Cases
- Motoare de căutare imagini
- Ghidarea generării text-în-imagine
- Răspunsuri la întrebări vizuale