Kontrastiv fortræning af sprog-billede
term_id: contrastive_languageimage_pre_training
Category: training_techniques
Definition
Kontrastiv fortræning af sprog-billede (CLIP) er en neuralt netværksarkitektur trænet på billeder og deres tilhørende billedtekster fra internettet. Den bruger et kontraktivt formål til at maksimere ligheden mellem korrekte billede-tekst-par sammenlignet med tilfældige par.
Summary
En multimodal fortræningsmetode, der tilpasser billed- og tekstrepræsentationer ved hjælp af kontrastive tabfunktioner.
Key Concepts
- Multimodal læring
- Cosinus-similaritet
- Zero-shot klassificering
- Encoder-arkitektur
Use Cases
- Billedsøgemaskiner
- Styring af tekst-til-billede generering
- Visuel spørgsmålssvarende