Kontrastiv språk-bilde-forhåndsopplæring

term_id: contrastive_languageimage_pre_training

Category: training_techniques

Definition

Kontrastiv språk-bilde-forhåndsopplæring (CLIP) er en nevralt nettverksarkitektur trent på bilder og deres tilsvarende bildetekster fra internett. Den bruker et kontraktivt mål for å maksimere samvariasjonen mellom representasjoner av korresponderende bilder og tekster, mens den minimerer den for ikke-korresponderende par.

Summary

En multimodal forhåndsopplæringsmetode som tilpasser bilde- og tekstrepresentasjoner ved hjelp av kontraktive tap-funksjoner.

Key Concepts

  • Multimodal læring
  • Kosinuslikhet
  • Null-skuddsklassifisering
  • Koderarkitektur

Use Cases

  • Bildesøkemotorer
  • Retningslinjer for tekst-til-bilde-generering
  • Visuelle spørsmål og svar