Visão e Linguagem

term_id: vision_language

Category: application_paradigms

Definition

Os modelos de Visão e Linguagem, frequentemente referidos como Modelos de Linguagem Grande Multimodais (MLLMs), integram visão computacional e processamento de linguagem natural. Eles permitem que a IA compreenda imagens e gere texto

Summary

Modelos de Visão e Linguagem são sistemas de IA que processam e correlacionam dados visuais com informações textuais para compreender contextos multimodais.

Key Concepts

  • Multimodalidade
  • Alinhamento Cross-modal
  • Legenda de Imagens
  • Resposta a Perguntas Visuais

Use Cases

  • Geração automática de legendas para imagens
  • Sistemas de resposta a perguntas visuais
  • Moderação de conteúdo com contexto