워드 뱅크 모델

term_id: bag_of_words_model

Category: basic_concepts

Definition

이 자연어 처리 기법은 구문과 순서를 무시하고 텍스트를 단어의 다중 집합(multiset)으로 표현합니다. 이는 문서의 단어 빈도나 존재 여부에 기반하여…

Summary

워드 뱅크 모델은 문법과 단어 순서를 무시한 채 문서 내 단어의 출현만을 설명하는 텍스트의 단순화된 표현 방식입니다.

Key Concepts

  • 토큰화
  • 빈도 계산
  • 벡터 공간
  • 특징 추출

Use Cases

  • 텍스트 분류
  • 스팸 필터링
  • 정보 검색

Code Example

1
2
3
4
from sklearn.feature_extraction.text import CountVectorizer
corpus = ["Hello world", "World hello"]
vectorizer = CountVectorizer()
X = vectorizer.fit_transform(corpus)