Tokenizare

term_id: tokenization

Category: engineering_practice

Definition

Tokenizarea este un pas critic de preprocesare în Procesarea Limbajului Natural (PNL/NLP) care convertește textul nestructurat în date structurate, potrivite pentru ingestia în modele. Aceasta implică descompunerea propozițiilor

Summary

Tokenizarea este procesul de împărțire a textului brut în unități mai mici numite tokenuri, care pot fi procesate de algoritmi de învățare automată.

Key Concepts

  • Împărțirea Textului
  • Preprocesare
  • WordPiece
  • Codare Byte-Pair

Use Cases

  • Pregătirea seturilor de date pentru antrenamentul BERT
  • Formatarea intrării pentru modelele GPT
  • Curățarea datelor pentru analiza sentimentelor

Code Example

1
2
3
from transformers import AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained('bert-base-uncased')
tokens = tokenizer.tokenize('Hello world!')