Vllm

term_id: vllm

Category: application_paradigms

Definition

vLLM (Virtual Large Language Model) là một thư viện mã nguồn mở được thiết kế để tăng tốc việc triển khai LLM. Nó giới thiệu PagedAttention, một kỹ thuật quản lý bộ nhớ lấy cảm hứng từ bộ nhớ ảo trong hệ điều hành…

Summary

vLLM là một công cụ suy luận có thông lượng cao và hiệu quả bộ nhớ cho các Mô hình Ngôn ngữ Lớn, sử dụng cơ chế PagedAttention để tối ưu hóa việc sử dụng bộ nhớ GPU.

Key Concepts

  • PagedAttention
  • Quản lý Bộ nhớ Cache KV
  • Triển khai Suy luận
  • Tối ưu hóa Thông lượng

Use Cases

  • Triển khai API chịu tải cao
  • Xử lý suy luận theo lô
  • Triển khai LLM tiết kiệm chi phí

Code Example

1
2
3
4
5
from vllm import LLM, SamplingParams
llm = LLM(model="facebook/opt-125m")
prompts = ["Hello, my name is", "The capital of France is"]
sampling_params = SamplingParams(temperature=0.8, top_p=0.95)
outputs = llm.generate(prompts, sampling_params)