멀티모달 표현 학습
term_id: multimodal_representation_learning
Category: training_techniques
Definition
멀티모달 표현 학습은 텍스트, 이미지, 오디오, 비디오 등 서로 다른 유형의 데이터 소스에서 정보를 처리하고 통합하여 공유 잠재 공간으로 만드는 모델을 훈련하는 과정을 포함합니다.
Summary
여러 데이터 모달리티로부터 통합된 특징 표현을 동시에 학습하는 기술입니다.
Key Concepts
- 크로스모달 정렬
- 공유 잠재 공간
- 특징 융합
- 모달리티별 인코더
Use Cases
- 이미지 캡셔닝
- 비디오 검색
- 시각적 질문 답변