Vision-Language-Modelle
term_id: vision_language
Category: application_paradigms
Definition
Vision-Language-Modelle, oft als Multimodale Große Sprachmodelle (MLLMs) bezeichnet, integrieren Computer Vision und Natural Language Processing. Sie ermöglichen es KI, Bilder zu verstehen und Text zu generieren.
Summary
Vision-Language-Modelle sind KI-Systeme, die visuelle Daten mit textuellen Informationen verarbeiten und korrelieren, um multimodale Kontexte zu verstehen.
Key Concepts
- Multimodalität
- Cross-modale Ausrichtung
- Bildunterschriftgenerierung
- Visuelles Fragenbeantworten
Use Cases
- Automatisierte Bildunterschriftgenerierung
- Systeme zum visuellen Fragenbeantworten
- Inhaltsmoderation mit Kontextverständnis