Antrenament Precoce Contrastiv Limbaj-Imagine

term_id: contrastive_languageimage_pre_training

Category: training_techniques

Definition

Antrenamentul precoce contrastiv limbaj-imagine (CLIP) este o arhitectură de rețea neuronală antrenată pe imagini și legendile lor corespunzătoare, preluate de pe internet. Utilizează un obiectiv contrastiv pentru a maximiza similitudinea dintre perechile imagine-text corelate și a minimiza cea dintre cele necorelate.

Summary

O metodă de antrenament preliminar multimodal care aliniază reprezentările imaginilor și textului folosind funcții de pierdere contrastivă.

Key Concepts

  • Învățare Multimodală
  • Similitudine Cosinus
  • Clasificare Zero-shot
  • Arhitectură Encoder

Use Cases

  • Motoare de căutare imagini
  • Ghidarea generării text-în-imagine
  • Răspunsuri la întrebări vizuale