Jetonnisation

term_id: tokenization

Category: engineering_practice

Definition

La jetonnisation est une étape critique de prétraitement en Traitement Automatique du Langage Naturel (TALN) qui convertit le texte non structuré en données structurées adaptées à l’ingestion par les modèles. Elle implique la décomposition des phrases en éléments significatifs tels que des mots ou des fragments de mots.

Summary

La jetonnisation est le processus de division du texte brut en unités plus petites appelées jets, qui peuvent être traitées par des algorithmes d’apprentissage automatique.

Key Concepts

  • Découpage de Texte
  • Prétraitement
  • WordPiece
  • Byte-Pair Encoding

Use Cases

  • Préparation des jeux de données pour l’entraînement de BERT
  • Formatage des entrées pour les modèles GPT
  • Nettoyage des données pour l’analyse de sentiments

Code Example

1
2
3
from transformers import AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained('bert-base-uncased')
tokens = tokenizer.tokenize('Hello world!')