Transformeur

term_id: transformer

Category: basic_concepts

Definition

Introduit dans l’article « Attention Is All You Need », l’architecture Transformer a révolutionné le traitement du langage naturel et au-delà. Elle utilise une auto-attention multi-têtes pour pondérer l’importance des

Summary

Une architecture d’apprentissage profond basée sur des mécanismes d’auto-attention qui traite les données séquentielles en parallèle plutôt que séquentiellement.

Key Concepts

  • Auto-attention
  • Attention multi-têtes
  • Encodage positionnel
  • Structure Encodeur-Décodeur

Use Cases

  • Traduction automatique
  • Génération de texte
  • Reconnaissance d’images (ViT)

Code Example

1
2
import torch.nn as nn
attention_layer = nn.MultiheadAttention(embed_dim=512, num_heads=8)