PagedAttention
term_id: pagedattention
Category: training_techniques
Definition
PagedAttention est une technique introduite par le projet vLLM pour améliorer l’efficacité de l’inférence des grands modèles de langage. Elle résout les problèmes de fragmentation et de surcharge liés à la gestion du cache KV, en permettant une allocation de mémoire dynamique et non contiguë, similaire à la gestion de la mémoire dans les systèmes d’exploitation modernes.
Summary
PagedAttention est un algorithme de gestion de la mémoire qui adapte les concepts de pagination de la mémoire virtuelle pour optimiser le stockage et l’accès aux caches Clé-Valeur (KV) dans les modèles de type transformeur.
Key Concepts
- Gestion du cache KV
- Fragmentation de la mémoire
- Optimisation de l’inférence
- Pagination de la mémoire virtuelle
Use Cases
- Service de LLM à haut débit
- Réduction de l’utilisation de la mémoire GPU
- Optimisation du traitement par lots en production