QLoRA

term_id: qlora

Category: training_techniques

Definition

QLoRA kết hợp Điều chỉnh hạng thấp (LoRA) với lượng tử hóa 4-bit để giảm đáng kể dung lượng bộ nhớ cần thiết cho việc tinh chỉnh các mô hình khổng lồ. Bằng cách lưu trữ trọng số ở định dạng 4-bit và thêm các bộ thích ứng hạng thấp.

Summary

Điều chỉnh hạng thấp lượng tử hóa (Quantized Low-Rank Adaptation), một phương pháp tinh chỉnh hiệu quả các mô hình ngôn ngữ lớn bằng cách sử dụng lượng tử hóa 4-bit và các bộ thích ứng hạng thấp.

Key Concepts

  • Điều chỉnh hạng thấp
  • Lượng tử hóa 4-bit
  • Hiệu quả bộ nhớ
  • Tinh chỉnh (Fine-Tuning)

Use Cases

  • Tinh chỉnh trên GPU tiêu dùng
  • Môi trường hạn chế tài nguyên
  • Lặp lại mô hình nhanh chóng

Code Example

1
2
3
from peft import LoraConfig, get_peft_model
config = LoraConfig(r=8, lora_alpha=32, target_modules=["q_proj", "v_proj"])
model = get_peft_model(base_model, config)