Pre-addestramento Contrastivo Lingua-Immagine

term_id: contrastive_languageimage_pre_training

Category: training_techniques

Definition

Il Pre-addestramento Contrastivo Lingua-Immagine (CLIP) è un’architettura di rete neurale addestrata su immagini e le loro didascalie corrispondenti prese da Internet. Utilizza un obiettivo contrastivo per massimizzare la coerenza…

Summary

Un metodo di pre-addestramento multimodale che allinea le rappresentazioni di immagini e testo utilizzando funzioni di perdita contrastiva.

Key Concepts

  • Apprendimento Multimodale
  • Somiglianza Cosine
  • Classificazione Zero-shot
  • Architettura Encoder

Use Cases

  • Motori di ricerca per immagini
  • Guida alla generazione di immagini da testo
  • Risposta a domande visive