PagedAttention

term_id: pagedattention

Category: training_techniques

Definition

PagedAttention es una técnica introducida por el proyecto vLLM para mejorar la eficiencia de la inferencia de Grandes Modelos de Lenguaje. Aborda los problemas de fragmentación y sobrecarga en la gestión de la caché KV,

Summary

PagedAttention es un algoritmo de gestión de memoria que adapta los conceptos de paginación de memoria virtual para optimizar el almacenamiento y acceso de las cachés de Clave-Valor (KV) en modelos transformadores.

Key Concepts

  • Gestión de Caché KV
  • Fragmentación de Memoria
  • Optimización de Inferencia
  • Paginación de Memoria Virtual

Use Cases

  • Servicio de LLM de alto rendimiento
  • Reducción del uso de memoria GPU
  • Optimización del procesamiento por lotes en producción