Tokenización

term_id: tokenization

Category: engineering_practice

Definition

La tokenización es un paso crítico de preprocesamiento en el Procesamiento del Lenguaje Natural (PLN) que convierte el texto no estructurado en datos estructurados adecuados para la ingesta del modelo. Implica descomponer oraciones y párrafos en unidades manejables que el algoritmo puede entender matemáticamente.

Summary

La tokenización es el proceso de dividir el texto sin formato en unidades más pequeñas llamadas tokens, que pueden ser procesadas por algoritmos de aprendizaje automático.

Key Concepts

  • División de Texto
  • Preprocesamiento
  • WordPiece
  • Codificación por Pares de Bytes

Use Cases

  • Preparación de conjuntos de datos para entrenamiento de BERT
  • Formato de entrada para modelos GPT
  • Limpieza de datos para análisis de sentimiento

Code Example

1
2
3
from transformers import AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained('bert-base-uncased')
tokens = tokenizer.tokenize('Hello world!')