Контрастное предобучение языка и изображений

term_id: contrastive_languageimage_pre_training

Category: training_techniques

Definition

Контрастное предобучение языка и изображений (CLIP) — это архитектура нейронной сети, обученная на изображениях и соответствующих им подписях из интернета. Она использует контрастную цель для максимизации сходства между парами «изображение-текст» и минимизации сходства между несоответствующими парами.

Summary

Мультимодальный метод предобучения, который согласовывает представления изображений и текста с помощью функций контрастных потерь.

Key Concepts

  • Мультимодальное обучение
  • Косинусное сходство
  • Классификация нулевого образца (Zero-shot)
  • Архитектура энкодера

Use Cases

  • Поисковые системы по изображениям
  • Направление генерации изображений по тексту
  • Отвечание на вопросы по визуальным материалам