トークン化

term_id: tokenization

Category: engineering_practice

Definition

トークン化は、構造化されていないテキストをモデルが取り込める構造化データに変換する自然言語処理(NLP)における重要な前処理ステップです。これには、文章を単語やサブワードに分解し、それらを一意の数値IDに変換する作業が含まれます。適切なトークン化は、モデルの学習効率と精度を決定づける基盤となります。

Summary

トークン化とは、生のテキストを機械学習アルゴリズムが処理できる「トークン」と呼ばれる小さな単位に分割するプロセスです。

Key Concepts

  • テキスト分割
  • 前処理
  • WordPiece
  • バイトペアエンコーディング

Use Cases

  • BERT学習用のデータセット準備
  • GPTモデルへの入力フォーマット
  • 感情分析のためのデータクリーニング

Code Example

1
2
3
from transformers import AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained('bert-base-uncased')
tokens = tokenizer.tokenize('Hello world!')