Multimodal representasjonslæring

term_id: multimodal_representation_learning

Category: training_techniques

Definition

Multimodal representasjonslæring innebærer å trene modeller til å behandle og integrere informasjon fra ulike typer datakilder, som tekst, bilder, lyd og video, inn i et felles latent rom.

Summary

En teknikk som lærer enhetlige funksjonsrepresentasjoner fra flere datamodaler samtidig.

Key Concepts

  • Tverrmodal tilpasning
  • Delt latent rom
  • Funksjonsfusjon
  • Modalitetsspesifikke kodere

Use Cases

  • Bildeteksting
  • Videosøking
  • Visuell spørsmålsbesvarelse