Multimodal
term_id: multimodal
Category: application_paradigms
Definition
Multimodale AI-systemer integrerer informasjon fra ulike sanseinntrykk for å danne en mer omfattende forståelse av verden. I motsetning til unimodale modeller som er begrenset til én datatype, kan multimodale modeller forstå og sammenkoble ulike former for data.
Summary
Refererer til AI-modeller som kan behandle og generere innhold på tvers av flere datatyper, som tekst, bilder, lyd og video, samtidig.
Key Concepts
- Kryss-modellærdom
- Datasamling (Data Fusion)
- Representasjonslæring
- Sanseinput
Use Cases
- Visuelt spørsmålssvar
- Videobeskrivelse (Video captioning)
- Lyd-visuell talegjenkjenning