Tokenizacja

term_id: tokenization

Category: engineering_practice

Definition

Tokenizacja jest krytycznym krokiem przetwarzania wstępnego w Przetwarzaniu Języka Naturalnego (NLP), który przekształca niesformatowany tekst w dane strukturalne odpowiednie do wprowadzenia do modelu. Obejmuje to rozbijanie zdań na pojedyncze tokeny za pomocą metod takich jak WordPiece czy Byte-Pair Encoding.

Summary

Tokenizacja to proces dzielenia surowego tekstu na mniejsze jednostki zwane tokenami, które mogą być przetwarzane przez algorytmy uczenia maszynowego.

Key Concepts

  • Dzielenie tekstu
  • Przetwarzanie wstępne
  • WordPiece (metoda tokenizacji)
  • Byte-Pair Encoding (BPE)

Use Cases

  • Przygotowywanie zbiorów danych do treningu modelu BERT
  • Formatowanie wejścia dla modeli GPT
  • Czyszczenie danych przed analizą sentymentu

Code Example

1
2
3
from transformers import AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained('bert-base-uncased')
tokens = tokenizer.tokenize('Hello world!')