多模态表示学习

term_id: multimodal_representation_learning

Category: training_techniques

Definition

多模态表示学习涉及训练模型以处理和整合来自不同类型数据源(如文本、图像、音频和视频)的信息,将其映射到共享的潜在空间中。

Summary

一种同时从多个数据模态中学习统一特征表示的技术。

Key Concepts

  • 跨模态对齐
  • 共享潜在空间
  • 特征融合
  • 模态特定编码器

Use Cases

  • 图像描述生成
  • 视频检索
  • 视觉问答