Tokenisasi

term_id: tokenization

Category: engineering_practice

Definition

Tokenisasi adalah langkah pra-pemrosesan kritis dalam Pemrosesan Bahasa Alami (NLP) yang mengubah teks tidak terstruktur menjadi data terstruktur yang cocok untuk dimakan oleh model. Proses ini melibatkan pemecahan kalimat atau dokumen menjadi bagian-bagian kecil seperti kata atau subkata, seringkali menggunakan teknik seperti WordPiece atau Byte-Pair Encoding.

Summary

Tokenisasi adalah proses memecah teks mentah menjadi unit-unit lebih kecil yang disebut token, yang dapat diproses oleh algoritma pembelajaran mesin.

Key Concepts

  • Pemisahan Teks
  • Pra-pemrosesan
  • WordPiece
  • Byte-Pair Encoding

Use Cases

  • Menyiapkan dataset untuk pelatihan BERT
  • Format input untuk model GPT
  • Pembersihan data untuk analisis sentimen

Code Example

1
2
3
from transformers import AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained('bert-base-uncased')
tokens = tokenizer.tokenize('Hello world!')