Lenguaje Visual

term_id: vision_language

Category: application_paradigms

Definition

Los modelos Visión-Lenguaje, a menudo denominados Modelos de Lenguaje Grande Multimodales (MLLM), integran la visión por computadora y el procesamiento de lenguaje natural. Permiten a la IA comprender imágenes y generar texto

Summary

Los modelos Visión-Lenguaje son sistemas de IA que procesan y correlacionan datos visuales con información textual para comprender contextos multimodales.

Key Concepts

  • Multimodalidad
  • Alineación Transmodal
  • Descripción de Imágenes
  • Respuesta a Preguntas Visuales

Use Cases

  • Generación automática de descripciones de imágenes
  • Sistemas de respuesta a preguntas visuales
  • Moderación de contenido con contexto