WordPiece

term_id: wordpiece

Category: engineering_practice

Definition

O WordPiece é um método de tokenização amplamente utilizado em modelos de processamento de linguagem natural, como BERT e ALBERT. Ele divide palavras em unidades menores de subpalavras para gerenciar a riqueza morfológica e reduzir o tamanho do vocabulário, permitindo que o modelo lide eficazmente com palavras raras ou não vistas anteriormente.

Summary

Um algoritmo de tokenização de subpalavras que mescla recursivamente os pares de caracteres mais frequentes para lidar com palavras fora do vocabulário.

Key Concepts

  • Tokenização de subpalavras
  • Expansão de vocabulário
  • Tratamento de palavras fora do vocabulário
  • Análise morfológica

Use Cases

  • Pré-processamento de texto para modelos BERT
  • Manipulação de idiomas com poucos recursos
  • Redução do tamanho da matriz de embeddings

Code Example

1
2
3
4
from transformers import BertTokenizer
tokenizer = BertTokenizer.from_pretrained('bert-base-uncased')
tokens = tokenizer.tokenize('unhappiness')
print(tokens)