ボキャブラリーバッグモデル

term_id: bag_of_words_model

Category: basic_concepts

Definition

この自然言語処理技法は、構文や順序を無視して、テキストを単語の多重集合(bag)として表します。これにより、単語の頻度や存在に基づいてドキュメントを数値ベクトルに変換します。

Summary

ボキャブラリーバッグモデルは、文法や語順を無視して、単語の出現頻度のみでドキュメントを記述するテキストの簡略化された表現方法です。

Key Concepts

  • トークン化
  • 頻度カウント
  • ベクトル空間
  • 特徴抽出

Use Cases

  • テキスト分類
  • スパムフィルタリング
  • 情報検索

Code Example

1
2
3
4
from sklearn.feature_extraction.text import CountVectorizer
corpus = ["Hello world", "World hello"]
vectorizer = CountVectorizer()
X = vectorizer.fit_transform(corpus)