Vision-Language
term_id: vision_language
Category: application_paradigms
Definition
Les modèles Vision-Language, souvent appelés grands modèles de langage multimodaux (MLLMs), intègrent la vision par ordinateur et le traitement du langage naturel. Ils permettent à l’IA de comprendre les images et de générer du texte
Summary
Les modèles Vision-Language sont des systèmes d’IA qui traitent et corrèlent les données visuelles avec les informations textuelles pour comprendre les contextes multimodaux.
Key Concepts
- Multimodalité
- Alignement inter-modalités
- Légende d’image
- Réponse aux questions visuelles
Use Cases
- Légendage automatique d’images
- Systèmes de réponse aux questions visuelles
- Modération de contenu avec contexte