Kontrastiv fortræning af sprog-billede

term_id: contrastive_languageimage_pre_training

Category: training_techniques

Definition

Kontrastiv fortræning af sprog-billede (CLIP) er en neuralt netværksarkitektur trænet på billeder og deres tilhørende billedtekster fra internettet. Den bruger et kontraktivt formål til at maksimere ligheden mellem korrekte billede-tekst-par sammenlignet med tilfældige par.

Summary

En multimodal fortræningsmetode, der tilpasser billed- og tekstrepræsentationer ved hjælp af kontrastive tabfunktioner.

Key Concepts

  • Multimodal læring
  • Cosinus-similaritet
  • Zero-shot klassificering
  • Encoder-arkitektur

Use Cases

  • Billedsøgemaskiner
  • Styring af tekst-til-billede generering
  • Visuel spørgsmålssvarende