Vllm
term_id: vllm
Category: application_paradigms
Definition
vLLM (Virtual Large Language Model) adalah pustaka sumber terbuka yang dirancang untuk mempercepat penyajian LLM. Alat ini memperkenalkan PagedAttention, sebuah teknik manajemen memori yang terinspirasi oleh memori virtual sistem operasi
Summary
vLLM adalah mesin inferensi ber throughput tinggi dan hemat memori untuk Model Bahasa Besar, yang memanfaatkan PagedAttention untuk mengoptimalkan penggunaan memori GPU.
Key Concepts
- PagedAttention
- Manajemen KV Cache
- Penyajian Inferensi
- Optimasi Throughput
Use Cases
- Penyajian API dengan konkurensi tinggi
- Pemrosesan inferensi batch
- Penyebaran LLM yang hemat biaya
Code Example
| |