PagedAttention
term_id: pagedattention
Category: training_techniques
Definition
PagedAttention to technika wprowadzona przez projekt vLLM w celu poprawy wydajności wnioskowania dużych modeli językowych. Rozwiązuje problemy fragmentacji i narzutów związanych z zarządzaniem buforem KV, dzieląc go na strony pamięci podobnie jak w systemach operacyjnych, co pozwala na efektywne wykorzystanie pamięci GPU i eliminację marnotrawstwa zasobów podczas generowania tekstu.
Summary
PagedAttention to algorytm zarządzania pamięcią, który adaptuje koncepcje stronnicowania pamięci wirtualnej do optymalizacji przechowywania i dostępu do buforów Klucz-Wartość (KV) w modelach transformera.
Key Concepts
- Zarządzanie buforem KV
- Fragmentacja pamięci
- Optymalizacja wnioskowania
- Stronicowanie pamięci wirtualnej
Use Cases
- Obsługa LLM o wysokim przepływie
- Redukcja zużycia pamięci GPU
- Optymalizacja przetwarzania wsadowego w produkcji