PagedAttention

term_id: pagedattention

Category: training_techniques

Definition

PagedAttention adalah teknik yang diperkenalkan oleh proyek vLLM untuk meningkatkan efisiensi inferensi Model Bahasa Besar. Teknik ini mengatasi masalah fragmentasi dan overhead dalam mengelola cache KV, w

Summary

PagedAttention adalah algoritma manajemen memori yang mengadaptasi konsep paging memori virtual untuk mengoptimalkan penyimpanan dan akses cache Key-Value (KV) dalam model transformer.

Key Concepts

  • Manajemen Cache KV
  • Fragmentasi Memori
  • Optimasi Inferensi
  • Paging Memori Virtual

Use Cases

  • Penyajian LLM ber throughput tinggi
  • Mengurangi penggunaan memori GPU
  • Mengoptimalkan pemrosesan batch dalam produksi