Pré-treinamento Contrastivo de Linguagem e Imagem
term_id: contrastive_languageimage_pre_training
Category: training_techniques
Definition
O Pré-treinamento Contrastivo de Linguagem e Imagem (CLIP) é uma arquitetura de rede neural treinada em imagens e suas legendas correspondentes da internet. Ele usa um objetivo contrastivo para maximizar a co…
Summary
Um método de pré-treinamento multimodal que alinha representações de imagem e texto usando funções de perda contrastiva.
Key Concepts
- Aprendizado Multimodal
- Similaridade Cosseno
- Classificação Zero-shot
- Arquitetura de Codificador
Use Cases
- Motores de busca de imagens
- Orientação para geração de imagens a partir de texto
- Resposta a perguntas visuais
Related Terms
- DALL-E (modelo de IA generativa para criar imagens a partir de descrições de texto)
- Transformadores de Visão (arquiteturas baseadas em transformers para processamento de imagens)
- Processamento de Linguagem Natural (campo da IA focado na interação entre computadores e linguagem humana)
- Espaços de Embedding (representações vetoriais de dados em um espaço contínuo)