대조적 언어-이미지 사전 학습

term_id: contrastive_languageimage_pre_training

Category: training_techniques

Definition

대조적 언어-이미지 사전 학습(CLIP)은 인터넷상의 이미지와 해당 캡션으로 훈련된 신경망 아키텍처입니다. 이 방법은 대조적 목적 함수를 사용하여 이미지와 텍스트 임베딩 공간에서 의미적으로 유사한 쌍의 거리를 최소화하고, 유사하지 않은 쌍의 거리를 최대화함으로써 두 모달 간의 정렬을 학습합니다.

Summary

대조 손실 함수를 사용하여 이미지와 텍스트 표현을 정렬하는 멀티모달 사전 학습 방법입니다.

Key Concepts

  • 멀티모달 학습
  • 코사인 유사도
  • 제로샷 분류
  • 인코더 아키텍처

Use Cases

  • 이미지 검색 엔진
  • 텍스트 기반 이미지 생성 가이드
  • 시각적 질문 응답