Multimodal representasjonslæring
term_id: multimodal_representation_learning
Category: training_techniques
Definition
Multimodal representasjonslæring innebærer å trene modeller til å behandle og integrere informasjon fra ulike typer datakilder, som tekst, bilder, lyd og video, inn i et felles latent rom.
Summary
En teknikk som lærer enhetlige funksjonsrepresentasjoner fra flere datamodaler samtidig.
Key Concepts
- Tverrmodal tilpasning
- Delt latent rom
- Funksjonsfusjon
- Modalitetsspesifikke kodere
Use Cases
- Bildeteksting
- Videosøking
- Visuell spørsmålsbesvarelse