Tokenizace

term_id: tokenization

Category: engineering_practice

Definition

Tokenizace je kritický krok předzpracování v zpracování přirozeného jazyka (NLP), který převádí nestrukturovaný text na strukturovaná data vhodná pro ingestaci modelem. Zahrnuje rozkládání vět

Summary

Tokenizace je proces rozdělování surového textu na menší jednotky nazývané tokeny, které mohou být zpracovány algoritmy strojového učení.

Key Concepts

  • Rozdělení textu
  • Předzpracování
  • WordPiece
  • Kódování párováním bajtů (Byte-Pair Encoding)

Use Cases

  • Příprava datových sad pro trénink BERT
  • Formátování vstupu pro modely GPT
  • Čištění dat pro analýzu sentimentu

Code Example

1
2
3
from transformers import AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained('bert-base-uncased')
tokens = tokenizer.tokenize('Hello world!')