Tokenisointi

term_id: tokenization

Category: engineering_practice

Definition

Tokenisointi on kriittinen esikäsittelyvaihe luonnollisen kielentarkastelun (NLP) alueella, joka muuntaa rakenteettoman tekstin mallien syötteeksi soveltuvaksi rakenteelliseksi dataksi. Se sisältää lauseiden pilkkomisen pienempiin merkityksellisiin osiin.

Summary

Tokenisointi on prosessi, jossa raaka teksti pilkotaan pienemmiksi tokeni-yksiköiksi, joita koneoppimisalgoritmit voivat käsitellä.

Key Concepts

  • Tekstin pilkkominen
  • Esikäsittely
  • WordPiece
  • Byte-Pair Encoding

Use Cases

  • BERT-mallin koulutusdatasten valmistelu
  • GPT-mallien syötemuotoilu
  • Data siivous tunneanalyysiä varten

Code Example

1
2
3
from transformers import AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained('bert-base-uncased')
tokens = tokenizer.tokenize('Hello world!')