WordPiece

term_id: wordpiece

Category: engineering_practice

Definition

WordPiece est une méthode de tokenisation largement utilisée dans les modèles de traitement du langage naturel tels que BERT et ALBERT. Elle décompose les mots en unités de sous-mots plus petites afin de gérer la richesse morphologique et de réduire la taille du vocabulaire, permettant ainsi de mieux traiter les mots rares ou inconnus.

Summary

Un algorithme de tokenisation par sous-mots qui fusionne récursivement les paires de caractères les plus fréquentes pour gérer les mots hors vocabulaire.

Key Concepts

  • Tokenisation par sous-mot
  • Expansion du vocabulaire
  • Gestion des mots hors vocabulaire
  • Analyse morphologique

Use Cases

  • Prétraitement du texte pour les modèles BERT
  • Traitement des langues à ressources limitées
  • Réduction de la taille de la matrice d’embedding

Code Example

1
2
3
4
from transformers import BertTokenizer
tokenizer = BertTokenizer.from_pretrained('bert-base-uncased')
tokens = tokenizer.tokenize('unhappiness')
print(tokens)