PagedAttention

term_id: pagedattention

Category: training_techniques

Definition

PagedAttention to technika wprowadzona przez projekt vLLM w celu poprawy wydajności wnioskowania dużych modeli językowych. Rozwiązuje problemy fragmentacji i narzutów związanych z zarządzaniem buforem KV, dzieląc go na strony pamięci podobnie jak w systemach operacyjnych, co pozwala na efektywne wykorzystanie pamięci GPU i eliminację marnotrawstwa zasobów podczas generowania tekstu.

Summary

PagedAttention to algorytm zarządzania pamięcią, który adaptuje koncepcje stronnicowania pamięci wirtualnej do optymalizacji przechowywania i dostępu do buforów Klucz-Wartość (KV) w modelach transformera.

Key Concepts

  • Zarządzanie buforem KV
  • Fragmentacja pamięci
  • Optymalizacja wnioskowania
  • Stronicowanie pamięci wirtualnej

Use Cases

  • Obsługa LLM o wysokim przepływie
  • Redukcja zużycia pamięci GPU
  • Optymalizacja przetwarzania wsadowego w produkcji