Modelo de bolsa de palabras

term_id: bag_of_words_model

Category: basic_concepts

Definition

Esta técnica de procesamiento de lenguaje natural representa el texto como una multiconjunto de palabras, desestimando la sintaxis y la secuencia. Convierte los documentos en vectores numéricos basados en la frecuencia o presencia de las palabras.

Summary

El modelo de bolsa de palabras es una representación simplificada del texto que describe la ocurrencia de palabras en un documento, ignorando la gramática y el orden de las palabras.

Key Concepts

  • Tokenización
  • Conteo de frecuencias
  • Espacio vectorial
  • Extracción de características

Use Cases

  • Clasificación de texto
  • Filtrado de spam
  • Recuperación de información

Code Example

1
2
3
4
from sklearn.feature_extraction.text import CountVectorizer
corpus = ["Hello world", "World hello"]
vectorizer = CountVectorizer()
X = vectorizer.fit_transform(corpus)