Tokenizálás

term_id: tokenization

Category: engineering_practice

Definition

A tokenizálás kritikus előfeldolgozási lépés a Természetes Nyelvfeldolgozásban (NLP), amely a strukturálatlan szöveget strukturált adattá alakítja a modellek számára. Ez magában foglalja a mondatok, szavak vagy akár karakterek felbontását olyan egységekre, amelyeket a modell vektorizálni és értelmezni tud.

Summary

A tokenizálás az a folyamat, amely során a nyers szöveget kisebb, tokeneknek nevezett egységekre bontják, amelyeket a gépi tanulási algoritmusok feldolgozhatnak.

Key Concepts

  • Szövegbontás
  • Előfeldolgozás
  • WordPiece
  • Byte-Pair Encoding (BPE)

Use Cases

  • Adathalmazok előkészítése BERT betanításához
  • Bemeneti formázás GPT modellekhez
  • Adattisztítás hangulatértékeléshez

Code Example

1
2
3
from transformers import AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained('bert-base-uncased')
tokens = tokenizer.tokenize('Hello world!')