Модель мешка слов

term_id: bag_of_words_model

Category: basic_concepts

Definition

Этот метод обработки естественного языка представляет текст как мультимножество слов, игнорируя синтаксис и последовательность. Он преобразует документы в числовые векторы на основе частоты слов или факта их наличия.

Summary

Модель мешка слов — это упрощенное представление текста, описывающее частоту встречаемости слов в документе, игнорируя грамматику и порядок слов.

Key Concepts

  • Токенизация
  • Подсчет частоты
  • Векторное пространство
  • Извлечение признаков

Use Cases

  • Классификация текстов
  • Фильтрация спама
  • Поиск информации

Code Example

1
2
3
4
from sklearn.feature_extraction.text import CountVectorizer
corpus = ["Hello world", "World hello"]
vectorizer = CountVectorizer()
X = vectorizer.fit_transform(corpus)