Embedding Model

term_id: embedding_model

Category: application_paradigms

Definition

Tyto modely mapují data s vysokou dimenzionalitou do nižšího dimenzionálního spojitého vektorového prostoru, kde jsou podobné položky umístěny blíže u sebe. Tato transformace zachycuje sémantické vztahy, což umožňuje efektivní vyhledávání a porovnávání dat.

Summary

Model pro vložení převádí surová data, jako je text nebo obrázky, do hustých číselných vektorů reprezentujících sémantický význam.

Key Concepts

  • Vektorové zastoupení
  • Sémantická podobnost
  • Redukce dimenzionality
  • Extrakce znaků

Use Cases

  • Výstavba sémantických vyhledávačů
  • Doporučovací systémy pro produkty nebo obsah
  • Clustrování podobných dokumentů nebo obrázků

Code Example

1
2
3
4
5
6
7
from transformers import AutoTokenizer, AutoModel
import torch

model = AutoModel.from_pretrained('sentence-transformers/all-MiniLM-L6-v2')
tokenizer = AutoTokenizer.from_pretrained('sentence-transformers/all-MiniLM-L6-v2')
inputs = tokenizer('Hello world', return_tensors='pt')
embeddings = model(**inputs).last_hidden_state.mean(dim=1)