Transformer

term_id: transformer

Category: basic_concepts

Definition

Die Transformer-Architektur, vorgestellt im Paper ‘Attention Is All You Need’, hat die Verarbeitung natürlicher Sprache und darüber hinaus revolutioniert. Sie nutzt Multi-Head-Selbst-Aufmerksamkeit, um die Bedeutung von…

Summary

Eine Deep-Learning-Architektur, die auf Selbst-Aufmerksamkeitsmechanismen basiert und sequenzielle Daten parallel statt sequentiell verarbeitet.

Key Concepts

  • Selbst-Aufmerksamkeit
  • Multi-Head-Aufmerksamkeit
  • Positions-Encoding
  • Encoder-Decoder-Struktur

Use Cases

  • Maschinelle Übersetzung
  • Textgenerierung
  • Bilderkennung (ViT)

Code Example

1
2
import torch.nn as nn
attention_layer = nn.MultiheadAttention(embed_dim=512, num_heads=8)