PagedAttention
term_id: pagedattention
Category: training_techniques
Definition
PagedAttention é uma técnica introduzida pelo projeto vLLM para melhorar a eficiência da inferência de Grandes Modelos de Linguagem (LLMs). Ela aborda problemas de fragmentação e sobrecarga no gerenciamento do cache KV, onde…
Summary
PagedAttention é um algoritmo de gerenciamento de memória que adapta conceitos de paginação de memória virtual para otimizar o armazenamento e acesso aos caches Key-Value (KV) em modelos transformadores.
Key Concepts
- Gerenciamento de Cache KV
- Fragmentação de Memória
- Otimização de Inferência
- Paginação de Memória Virtual
Use Cases
- Serviço de LLMs de alta vazão
- Redução do uso de memória GPU
- Otimização do processamento em lote em produção