Model Embeddingowy
term_id: embedding_model
Category: application_paradigms
Definition
Modele te mapują dane o wysokiej wymiarowości do niższymiarowej, ciągłej przestrzeni wektorowej, gdzie podobne elementy znajdują się bliżej siebie. Ta transformacja wychwytuje relacje semantyczne, umożliwiając efektywne wyszukiwanie i porównywanie danych.
Summary
Model embeddingowy przekształca surowe dane, takie jak tekst czy obrazy, w gęste wektory liczbowe reprezentujące znaczenie semantyczne.
Key Concepts
- Reprezentacja wektorowa
- Podobieństwo semantyczne
- Redukcja wymiarowości
- Ekstrakcja cech
Use Cases
- Budowanie silników wyszukiwania semantycznego
- Systemy rekomendacyjne dla produktów lub treści
- Grupowanie (clustering) podobnych dokumentów lub obrazów
Code Example
from transformers import AutoTokenizer, AutoModel
import torch
model = AutoModel.from_pretrained('sentence-transformers/all-MiniLM-L6-v2')
tokenizer = AutoTokenizer.from_pretrained('sentence-transformers/all-MiniLM-L6-v2')
inputs = tokenizer('Hello world', return_tensors='pt')
embeddings = model(**inputs).last_hidden_state.mean(dim=1)
Related Terms
- Word2Vec (model do generowania embeddingów słów na podstawie kontekstu)
- BERT (zaawansowany model językowy do przetwarzania tekstu, często używany do embeddingów)
- Vector Database (bazodan wektorowy, system do przechowywania i wyszukiwania embeddingów)
- Similarity Search (wyszukiwanie podobieństw, technika znajdowania najbliższych sąsiadów w przestrzeni wektorowej)