Tokenização

term_id: tokenization

Category: engineering_practice

Definition

A tokenização é uma etapa crítica de pré-processamento no Processamento de Linguagem Natural (PLN) que converte texto não estruturado em dados estruturados adequados para ingestão pelo modelo. Envolve a quebra de frases…

Summary

Tokenização é o processo de dividir texto bruto em unidades menores chamadas tokens, que podem ser processadas por algoritmos de aprendizado de máquina.

Key Concepts

  • Divisão de Texto
  • Pré-processamento
  • WordPiece
  • Byte-Pair Encoding (Codificação por Par de Bytes)

Use Cases

  • Preparação de conjuntos de dados para treinamento do BERT
  • Formatação de entrada para modelos GPT
  • Limpeza de dados para análise de sentimento

Code Example

1
2
3
from transformers import AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained('bert-base-uncased')
tokens = tokenizer.tokenize('Hello world!')