Embedding Model

term_id: embedding_model

Category: application_paradigms

Definition

Эти модели отображают высокоразмерные данные в непрерывное пространство меньшей размерности, где похожие элементы находятся ближе друг к другу. Это преобразование захватывает семантические отношения, позволяя эффективно искать сходство между объектами.

Summary

Модель эмбеддингов преобразует сырые данные, такие как текст или изображения, в плотные числовые векторы, представляющие семантическое значение.

Key Concepts

  • Векторное представление
  • Семантическое сходство
  • Снижение размерности
  • Извлечение признаков

Use Cases

  • Создание семантических поисковых систем
  • Рекомендательные системы для товаров или контента
  • Кластеризация похожих документов или изображений

Code Example

1
2
3
4
5
6
7
from transformers import AutoTokenizer, AutoModel
import torch

model = AutoModel.from_pretrained('sentence-transformers/all-MiniLM-L6-v2')
tokenizer = AutoTokenizer.from_pretrained('sentence-transformers/all-MiniLM-L6-v2')
inputs = tokenizer('Hello world', return_tensors='pt')
embeddings = model(**inputs).last_hidden_state.mean(dim=1)