Kontrastiv språk-bilde-forhåndsopplæring
term_id: contrastive_languageimage_pre_training
Category: training_techniques
Definition
Kontrastiv språk-bilde-forhåndsopplæring (CLIP) er en nevralt nettverksarkitektur trent på bilder og deres tilsvarende bildetekster fra internett. Den bruker et kontraktivt mål for å maksimere samvariasjonen mellom representasjoner av korresponderende bilder og tekster, mens den minimerer den for ikke-korresponderende par.
Summary
En multimodal forhåndsopplæringsmetode som tilpasser bilde- og tekstrepresentasjoner ved hjelp av kontraktive tap-funksjoner.
Key Concepts
- Multimodal læring
- Kosinuslikhet
- Null-skuddsklassifisering
- Koderarkitektur
Use Cases
- Bildesøkemotorer
- Retningslinjer for tekst-til-bilde-generering
- Visuelle spørsmål og svar