Conjunto de datos: Datos de incrustación/Captions de Flickr30K

term_id: datasetembedding_dataflickr30k_captions

Category: training_techniques

Definition

Flickr30K Captions es un conjunto de datos de referencia ampliamente utilizado que comprende 31.783 imágenes, cada una anotada con cinco oraciones distintas en inglés que describen el contenido visual. Sirve como recurso fundamental.

Summary

Un conjunto de datos multimodal que vincula 31.000 imágenes con descripciones generadas por humanos para entrenar modelos de incrustación entre modalidades.

Key Concepts

  • Aprendizaje multimodal
  • Alineación imagen-texto
  • Recuperación entre modalidades
  • Fundamentación visual

Use Cases

  • Construcción de motores de búsqueda de imágenes
  • Generación de descripciones de imágenes
  • Entrenamiento de modelos visión-lenguaje