Контрастное предобучение языка и изображений
term_id: contrastive_languageimage_pre_training
Category: training_techniques
Definition
Контрастное предобучение языка и изображений (CLIP) — это архитектура нейронной сети, обученная на изображениях и соответствующих им подписях из интернета. Она использует контрастную цель для максимизации сходства между парами «изображение-текст» и минимизации сходства между несоответствующими парами.
Summary
Мультимодальный метод предобучения, который согласовывает представления изображений и текста с помощью функций контрастных потерь.
Key Concepts
- Мультимодальное обучение
- Косинусное сходство
- Классификация нулевого образца (Zero-shot)
- Архитектура энкодера
Use Cases
- Поисковые системы по изображениям
- Направление генерации изображений по тексту
- Отвечание на вопросы по визуальным материалам