Tokenisering

term_id: tokenization

Category: engineering_practice

Definition

Tokenisering er et kritisk steg i forhåndsbehandling innen naturlig språkbehandling (NLP) som konverterer ustrukturert tekst til strukturerte data egnet for modellinndata. Det involverer å bryte ned setninger og tekster i håndterbare enheter.

Summary

Tokenisering er prosessen med å dele rå tekst inn i mindre enheter kalt tokens, som deretter kan behandles av maskinlæringsalgoritmer.

Key Concepts

  • Tekstsplitting
  • Forhåndsbehandling
  • WordPiece
  • Byte-Pair Encoding

Use Cases

  • Forberede datasett for BERT-trening
  • Inndataformatering for GPT-modeller
  • Datarengjøring for stemningsanalyse

Code Example

1
2
3
from transformers import AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained('bert-base-uncased')
tokens = tokenizer.tokenize('Hello world!')