Tokenisierung
term_id: tokenization
Category: engineering_practice
Definition
Tokenisierung ist ein kritischer Vorverarbeitungsschritt in der Natürlichen Sprachverarbeitung (NLP), der unstrukturierten Text in strukturierte Daten umwandelt, die für die Aufnahme durch Modelle geeignet sind. Dabei werden Sätze oder Texte in kleinere Einheiten zerlegt, die vom Modell interpretiert werden können.
Summary
Tokenisierung ist der Prozess des Aufteilens von Rohdaten in kleinere Einheiten, sogenannte Tokens, die von maschinellen Lernalgorithmen verarbeitet werden können.
Key Concepts
- Textaufteilung
- Vorverarbeitung
- WordPiece
- Byte-Pair-Encoding
Use Cases
- Vorbereitung von Datensätzen für das BERT-Training
- Eingabeformatierung für GPT-Modelle
- Datenbereinigung für die Stimmungsanalyse
Code Example
| |