Multimodal representationsinlärning
term_id: multimodal_representation_learning
Category: training_techniques
Definition
Multimodal representationsinlärning innebär att träna modeller för att bearbeta och integrera information från olika typer av datakällor, såsom text, bilder, ljud och video, till ett gemensamt latent rum.
Summary
En teknik som lär sig enhetliga funktionella representationer från flera datamodaler samtidigt.
Key Concepts
- Korsmodal utriktning
- Gemensamt latent rum
- Funktionsfusion
- Modalitetsspecifika kodare
Use Cases
- Bildtextning
- Videosökning
- Visuellt frågesvarande