PagedAttention
term_id: pagedattention
Category: training_techniques
Definition
PagedAttention adalah teknik yang diperkenalkan oleh proyek vLLM untuk meningkatkan efisiensi inferensi Model Bahasa Besar. Teknik ini mengatasi masalah fragmentasi dan overhead dalam mengelola cache KV, w
Summary
PagedAttention adalah algoritma manajemen memori yang mengadaptasi konsep paging memori virtual untuk mengoptimalkan penyimpanan dan akses cache Key-Value (KV) dalam model transformer.
Key Concepts
- Manajemen Cache KV
- Fragmentasi Memori
- Optimasi Inferensi
- Paging Memori Virtual
Use Cases
- Penyajian LLM ber throughput tinggi
- Mengurangi penggunaan memori GPU
- Mengoptimalkan pemrosesan batch dalam produksi