Tokenizálás
term_id: tokenization
Category: engineering_practice
Definition
A tokenizálás kritikus előfeldolgozási lépés a Természetes Nyelvfeldolgozásban (NLP), amely a strukturálatlan szöveget strukturált adattá alakítja a modellek számára. Ez magában foglalja a mondatok, szavak vagy akár karakterek felbontását olyan egységekre, amelyeket a modell vektorizálni és értelmezni tud.
Summary
A tokenizálás az a folyamat, amely során a nyers szöveget kisebb, tokeneknek nevezett egységekre bontják, amelyeket a gépi tanulási algoritmusok feldolgozhatnak.
Key Concepts
- Szövegbontás
- Előfeldolgozás
- WordPiece
- Byte-Pair Encoding (BPE)
Use Cases
- Adathalmazok előkészítése BERT betanításához
- Bemeneti formázás GPT modellekhez
- Adattisztítás hangulatértékeléshez
Code Example
| |