PagedAttention

term_id: pagedattention

Category: training_techniques

Definition

PagedAttention est une technique introduite par le projet vLLM pour améliorer l’efficacité de l’inférence des grands modèles de langage. Elle résout les problèmes de fragmentation et de surcharge liés à la gestion du cache KV, en permettant une allocation de mémoire dynamique et non contiguë, similaire à la gestion de la mémoire dans les systèmes d’exploitation modernes.

Summary

PagedAttention est un algorithme de gestion de la mémoire qui adapte les concepts de pagination de la mémoire virtuelle pour optimiser le stockage et l’accès aux caches Clé-Valeur (KV) dans les modèles de type transformeur.

Key Concepts

  • Gestion du cache KV
  • Fragmentation de la mémoire
  • Optimisation de l’inférence
  • Pagination de la mémoire virtuelle

Use Cases

  • Service de LLM à haut débit
  • Réduction de l’utilisation de la mémoire GPU
  • Optimisation du traitement par lots en production