Model tašky slov

term_id: bag_of_words_model

Category: basic_concepts

Definition

Tato technika zpracování přirozeného jazyka reprezentuje text jako množinu slov, aniž by zohledňovala syntaxi a sekvenci. Převádí dokumenty na číselné vektory založené na frekvenci slov nebo jejich přítomnosti.

Summary

Model tašky slov je zjednodušující reprezentace textu, která popisuje výskyt slov v dokumentu, přičemž ignoruje gramatiku a pořadí slov.

Key Concepts

  • Tokenizace
  • Počítání frekvencí
  • Vektorový prostor
  • Extrakce znaků

Use Cases

  • Klasifikace textu
  • Filtrování spamu
  • Informační vyhledávání

Code Example

1
2
3
4
from sklearn.feature_extraction.text import CountVectorizer
corpus = ["Hello world", "World hello"]
vectorizer = CountVectorizer()
X = vectorizer.fit_transform(corpus)