Vision-Language

term_id: vision_language

Category: application_paradigms

Definition

Les modèles Vision-Language, souvent appelés grands modèles de langage multimodaux (MLLMs), intègrent la vision par ordinateur et le traitement du langage naturel. Ils permettent à l’IA de comprendre les images et de générer du texte

Summary

Les modèles Vision-Language sont des systèmes d’IA qui traitent et corrèlent les données visuelles avec les informations textuelles pour comprendre les contextes multimodaux.

Key Concepts

  • Multimodalité
  • Alignement inter-modalités
  • Légende d’image
  • Réponse aux questions visuelles

Use Cases

  • Légendage automatique d’images
  • Systèmes de réponse aux questions visuelles
  • Modération de contenu avec contexte