Tokenisatie

term_id: tokenization

Category: engineering_practice

Definition

Tokenisatie is een kritieke stap in de voorbewerking van Natural Language Processing (NLP) die ongestructureerde tekst omzet in gestructureerde gegevens die geschikt zijn voor modelinvoer. Het houdt in dat zinnen en alinea’s worden opgesplitst in betekenisvolle eenheden, waardoor computers tekst kunnen begrijpen en analyseren binnen de beperkingen van hun architectuur.

Summary

Tokenisatie is het proces van het splitsen van ruwe tekst in kleinere eenheden genaamd tokens, die door machine learning-algoritmen kunnen worden verwerkt.

Key Concepts

  • Tekstsplitsing
  • Voorbewerking
  • WordPiece
  • Byte-Pair Encoding

Use Cases

  • Voorbereiden van datasets voor BERT-training
  • Indataformatie voor GPT-modellen
  • Gegevensopruiming voor sentimentanalyse

Code Example

1
2
3
from transformers import AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained('bert-base-uncased')
tokens = tokenizer.tokenize('Hello world!')