Modèle sac de mots

term_id: bag_of_words_model

Category: basic_concepts

Definition

Cette technique de traitement du langage naturel représente le texte comme un ensemble multiset de mots, en négligeant la syntaxe et la séquence. Il convertit les documents en vecteurs numériques basés sur la fréquence ou la présence des mots. P

Summary

Le modèle sac de mots est une représentation simplifiée du texte qui décrit la présence des mots dans un document, en ignorant la grammaire et l’ordre des mots.

Key Concepts

  • Tokenisation
  • Comptage de fréquence
  • Espace vectoriel
  • Extraction de caractéristiques

Use Cases

  • Classification de texte
  • Filtrage des spams
  • Récupération d’information

Code Example

1
2
3
4
from sklearn.feature_extraction.text import CountVectorizer
corpus = ["Hello world", "World hello"]
vectorizer = CountVectorizer()
X = vectorizer.fit_transform(corpus)