Apprentissage de représentation multimodale
term_id: multimodal_representation_learning
Category: training_techniques
Definition
L’apprentissage de représentation multimodale consiste à entraîner des modèles à traiter et intégrer des informations provenant de différentes sources de données, telles que le texte, les images, l’audio et la vidéo, dans un espace latent partagé.
Summary
Une technique qui apprend des représentations de caractéristiques unifiées à partir de plusieurs modalités de données simultanément.
Key Concepts
- Alignement inter-modalités
- Espace latent partagé
- Fusion de caractéristiques
- Encodeurs spécifiques à une modalité
Use Cases
- Légendage d’images
- Recherche vidéo
- Réponse visuelle aux questions