멀티모달

term_id: multimodal

Category: application_paradigms

Definition

멀티모달 AI 시스템은 서로 다른 감각 입력에서 정보를 통합하여 세계에 대한 더 포괄적인 이해를 형성합니다. 단일 유형의 데이터에만 제한된 유니모달(Unimodal) 모델과 달리, 멀티모달 모델은 다양한 모달리티 간의 관계를 학습합니다.(문단이 잘려 있어 완전한 번역은 생략됨)

Summary

텍스트, 이미지, 오디오, 비디오 등 여러 데이터 유형을 동시에 처리하고 생성할 수 있는 AI 모델을 의미합니다.

Key Concepts

  • 크로스 모달 학습(Cross-modal Learning)
  • 데이터 융합(Data Fusion)
  • 표현 학습(Representation Learning)
  • 감각 입력(Sensory Input)

Use Cases

  • 시각적 질문 답변(Visual Question Answering)
  • 비디오 캡셔닝(Video Captioning)
  • 오디오-비주얼 음성 인식(Audio-visual Speech Recognition)