Dataset: Embedding Data/Flickr30K Captions
term_id: datasetembedding_dataflickr30k_captions
Category: training_techniques
Definition
As legendas do Flickr30K são um conjunto de dados de referência amplamente utilizado, composto por 31.783 imagens, cada uma anotada com cinco sentenças distintas em inglês descrevendo o conteúdo visual. Elas servem como um recurso fund…
Summary
Um conjunto de dados multimodal que vincula 31.000 imagens a legendas geradas por humanos para treinar modelos de embedding cross-modal.
Key Concepts
- Aprendizado Multimodal
- Alinhamento Imagem-Texto
- Recuperação Cross-Modal
- Ancoragem Visual
Use Cases
- Construção de motores de busca de imagens
- Geração de descrições de imagens
- Treinamento de modelos visão-linguagem