Visão e Linguagem
term_id: vision_language
Category: application_paradigms
Definition
Os modelos de Visão e Linguagem, frequentemente referidos como Modelos de Linguagem Grande Multimodais (MLLMs), integram visão computacional e processamento de linguagem natural. Eles permitem que a IA compreenda imagens e gere texto
Summary
Modelos de Visão e Linguagem são sistemas de IA que processam e correlacionam dados visuais com informações textuais para compreender contextos multimodais.
Key Concepts
- Multimodalidade
- Alinhamento Cross-modal
- Legenda de Imagens
- Resposta a Perguntas Visuais
Use Cases
- Geração automática de legendas para imagens
- Sistemas de resposta a perguntas visuais
- Moderação de conteúdo com contexto