Pre-addestramento Contrastivo Lingua-Immagine
term_id: contrastive_languageimage_pre_training
Category: training_techniques
Definition
Il Pre-addestramento Contrastivo Lingua-Immagine (CLIP) è un’architettura di rete neurale addestrata su immagini e le loro didascalie corrispondenti prese da Internet. Utilizza un obiettivo contrastivo per massimizzare la coerenza…
Summary
Un metodo di pre-addestramento multimodale che allinea le rappresentazioni di immagini e testo utilizzando funzioni di perdita contrastiva.
Key Concepts
- Apprendimento Multimodale
- Somiglianza Cosine
- Classificazione Zero-shot
- Architettura Encoder
Use Cases
- Motori di ricerca per immagini
- Guida alla generazione di immagini da testo
- Risposta a domande visive