Kontrastiv förträning av språk och bild
term_id: contrastive_languageimage_pre_training
Category: training_techniques
Definition
Kontrastiv förträning av språk och bild (CLIP) är en neural nätverksarkitektur tränad på bilder och deras motsvarande bildtexter från internet. Den använder ett kontraktivt mål för att maximera likheten mellan korrekta bild-text-par och minimera likheten mellan felaktiga par.
Summary
En multimodal för träningsmetod som alignerar bild- och textrepresentationer med hjälp av kontraktiva förlustfunktioner.
Key Concepts
- Multimodal inlärning
- Cosinuslikhet
- Nollskotsklassificering
- Encoder-arkitektur
Use Cases
- Bilsökmotorer
- Styrning av text-till-bild-generering
- Visuell frågebesvarande