멀티모달 표현 학습

term_id: multimodal_representation_learning

Category: training_techniques

Definition

멀티모달 표현 학습은 텍스트, 이미지, 오디오, 비디오 등 서로 다른 유형의 데이터 소스에서 정보를 처리하고 통합하여 공유 잠재 공간으로 만드는 모델을 훈련하는 과정을 포함합니다.

Summary

여러 데이터 모달리티로부터 통합된 특징 표현을 동시에 학습하는 기술입니다.

Key Concepts

  • 크로스모달 정렬
  • 공유 잠재 공간
  • 특징 융합
  • 모달리티별 인코더

Use Cases

  • 이미지 캡셔닝
  • 비디오 검색
  • 시각적 질문 답변