エンベッディングモデル

term_id: embedding_model

Category: application_paradigms

Definition

これらのモデルは、高次元データをより低次元の連続的なベクトル空間にマッピングし、類似したアイテムが近くに位置するようにします。この変換は意味的な関係性を捉え、類似検索やクラスタリングなどを可能にします。

Summary

エンベッディングモデルは、テキストや画像などの生データを、意味を表す高密度の数値ベクトルに変換します。

Key Concepts

  • ベクトル表現
  • 意味的類似性
  • 次元削減
  • 特徴抽出

Use Cases

  • セマンティック検索エンジンの構築
  • 商品やコンテンツのためのレコメンデーションシステム
  • 類似ドキュメントや画像のクラスタリング

Code Example

1
2
3
4
5
6
7
from transformers import AutoTokenizer, AutoModel
import torch

model = AutoModel.from_pretrained('sentence-transformers/all-MiniLM-L6-v2')
tokenizer = AutoTokenizer.from_pretrained('sentence-transformers/all-MiniLM-L6-v2')
inputs = tokenizer('Hello world', return_tensors='pt')
embeddings = model(**inputs).last_hidden_state.mean(dim=1)