PagedAttention

term_id: pagedattention

Category: training_techniques

Definition

PagedAttention là một kỹ thuật được giới thiệu bởi dự án vLLM nhằm cải thiện hiệu suất suy luận của các Mô hình Ngôn ngữ Lớn (LLM). Nó giải quyết các vấn đề về phân mảnh và chi phí xử lý khi quản lý bộ nhớ đệm KV, vốn…

Summary

PagedAttention là một thuật toán quản lý bộ nhớ, áp dụng khái niệm phân trang bộ nhớ ảo để tối ưu hóa việc lưu trữ và truy cập bộ nhớ đệm Key-Value (KV) trong các mô hình Transformer.

Key Concepts

  • Quản lý KV Cache (Bộ nhớ đệm Key-Value)
  • Phân mảnh bộ nhớ (Memory Fragmentation)
  • Tối ưu hóa suy luận (Inference Optimization)
  • Phân trang bộ nhớ ảo (Virtual Memory Paging)

Use Cases

  • Phục vụ LLM thông lượng cao
  • Giảm thiểu việc sử dụng bộ nhớ GPU
  • Tối ưu hóa xử lý theo lô trong môi trường sản xuất