Vllm
term_id: vllm
Category: application_paradigms
Definition
vLLM (Virtual Large Language Model) ist eine Open-Source-Bibliothek, die darauf ausgelegt ist, das Serving von LLMs zu beschleunigen. Es führt PagedAttention ein, eine Speichermanagement-Technik, die von der virtuellen Speicherverwaltung von Be
Summary
vLLM ist eine hochdurchsatzorientierte und speichereffiziente Inferenz-Engine für Large Language Models, die PagedAttention nutzt, um die GPU-Speichernutzung zu optimieren.
Key Concepts
- PagedAttention
- KV-Cache-Management
- Inferenz-Serving
- Durchsatzoptimierung
Use Cases
- Serving von APIs mit hoher Parallelität
- Batch-Verarbeitung von Inferenzen
- Kosteneffiziente Bereitstellung von LLMs
Code Example
| |