PagedAttention

term_id: pagedattention

Category: training_techniques

Definition

PagedAttention é uma técnica introduzida pelo projeto vLLM para melhorar a eficiência da inferência de Grandes Modelos de Linguagem (LLMs). Ela aborda problemas de fragmentação e sobrecarga no gerenciamento do cache KV, onde…

Summary

PagedAttention é um algoritmo de gerenciamento de memória que adapta conceitos de paginação de memória virtual para otimizar o armazenamento e acesso aos caches Key-Value (KV) em modelos transformadores.

Key Concepts

  • Gerenciamento de Cache KV
  • Fragmentação de Memória
  • Otimização de Inferência
  • Paginação de Memória Virtual

Use Cases

  • Serviço de LLMs de alta vazão
  • Redução do uso de memória GPU
  • Otimização do processamento em lote em produção