Preentrenamiento contrastivo de lenguaje e imagen

term_id: contrastive_languageimage_pre_training

Category: training_techniques

Definition

El preentrenamiento contrastivo de lenguaje e imagen (CLIP) es una arquitectura de red neuronal entrenada con imágenes y sus correspondientes descripciones textuales de internet. Utiliza un objetivo contrastivo para maximizar la similitud entre pares positivos (imagen-texto coincidente) y minimizarla entre negativos.

Summary

Un método de preentrenamiento multimodal que alinea las representaciones de imágenes y texto utilizando funciones de pérdida contrastiva.

Key Concepts

  • Aprendizaje multimodal
  • Similitud coseno
  • Clasificación zero-shot
  • Arquitectura de codificador

Use Cases

  • Motores de búsqueda de imágenes
  • Guía para la generación de imágenes a partir de texto
  • Respuesta a preguntas visuales