Transformer

term_id: transformer

Category: basic_concepts

Definition

Przedstawiona w artykule „Attention Is All You Need”, architektura Transformer zrewolucjonizowała przetwarzanie języka naturalnego i inne dziedziny. Wykorzystuje wielogłowicowe samouważanie do ważenia znaczenia poszczególnych elementów wejściowych, umożliwiając efektywne modelowanie długich zależności.

Summary

Architektura głębokiego uczenia oparta na mechanizmach samouważania (self-attention), która przetwarza dane sekwencyjne równolegle, a nie sekwencyjnie.

Key Concepts

  • Samouważanie (Self-Attention)
  • Wielogłowicowe uwaga (Multi-Head Attention)
  • Kodowanie pozycyjne (Positional Encoding)
  • Struktura enkoder-dekodera

Use Cases

  • Tłumaczenie maszynowe
  • Generowanie tekstu
  • Rozpoznawanie obrazów (np. ViT)

Code Example

1
2
import torch.nn as nn
attention_layer = nn.MultiheadAttention(embed_dim=512, num_heads=8)