Multimodal representationsinlärning

term_id: multimodal_representation_learning

Category: training_techniques

Definition

Multimodal representationsinlärning innebär att träna modeller för att bearbeta och integrera information från olika typer av datakällor, såsom text, bilder, ljud och video, till ett gemensamt latent rum.

Summary

En teknik som lär sig enhetliga funktionella representationer från flera datamodaler samtidigt.

Key Concepts

  • Korsmodal utriktning
  • Gemensamt latent rum
  • Funktionsfusion
  • Modalitetsspecifika kodare

Use Cases

  • Bildtextning
  • Videosökning
  • Visuellt frågesvarande