Tokenisierung

term_id: tokenization

Category: engineering_practice

Definition

Tokenisierung ist ein kritischer Vorverarbeitungsschritt in der Natürlichen Sprachverarbeitung (NLP), der unstrukturierten Text in strukturierte Daten umwandelt, die für die Aufnahme durch Modelle geeignet sind. Dabei werden Sätze oder Texte in kleinere Einheiten zerlegt, die vom Modell interpretiert werden können.

Summary

Tokenisierung ist der Prozess des Aufteilens von Rohdaten in kleinere Einheiten, sogenannte Tokens, die von maschinellen Lernalgorithmen verarbeitet werden können.

Key Concepts

  • Textaufteilung
  • Vorverarbeitung
  • WordPiece
  • Byte-Pair-Encoding

Use Cases

  • Vorbereitung von Datensätzen für das BERT-Training
  • Eingabeformatierung für GPT-Modelle
  • Datenbereinigung für die Stimmungsanalyse

Code Example

1
2
3
from transformers import AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained('bert-base-uncased')
tokens = tokenizer.tokenize('Hello world!')