대조적 언어-이미지 사전 학습
term_id: contrastive_languageimage_pre_training
Category: training_techniques
Definition
대조적 언어-이미지 사전 학습(CLIP)은 인터넷상의 이미지와 해당 캡션으로 훈련된 신경망 아키텍처입니다. 이 방법은 대조적 목적 함수를 사용하여 이미지와 텍스트 임베딩 공간에서 의미적으로 유사한 쌍의 거리를 최소화하고, 유사하지 않은 쌍의 거리를 최대화함으로써 두 모달 간의 정렬을 학습합니다.
Summary
대조 손실 함수를 사용하여 이미지와 텍스트 표현을 정렬하는 멀티모달 사전 학습 방법입니다.
Key Concepts
- 멀티모달 학습
- 코사인 유사도
- 제로샷 분류
- 인코더 아키텍처
Use Cases
- 이미지 검색 엔진
- 텍스트 기반 이미지 생성 가이드
- 시각적 질문 응답