Kontrastiv förträning av språk och bild

term_id: contrastive_languageimage_pre_training

Category: training_techniques

Definition

Kontrastiv förträning av språk och bild (CLIP) är en neural nätverksarkitektur tränad på bilder och deras motsvarande bildtexter från internet. Den använder ett kontraktivt mål för att maximera likheten mellan korrekta bild-text-par och minimera likheten mellan felaktiga par.

Summary

En multimodal för träningsmetod som alignerar bild- och textrepresentationer med hjälp av kontraktiva förlustfunktioner.

Key Concepts

  • Multimodal inlärning
  • Cosinuslikhet
  • Nollskotsklassificering
  • Encoder-arkitektur

Use Cases

  • Bilsökmotorer
  • Styrning av text-till-bild-generering
  • Visuell frågebesvarande