QLoRA

term_id: qlora

Category: training_techniques

Definition

QLoRA kombinerer Low-Rank Adaptation (LoRA) med 4-bit-kvantisering for betydeligt at reducere hukommelsesforbruget ved finjustering af massive modeller. Ved at gemme vægte i 4-bit-format og tilføje træningsbare adaptere gøres finjustering mulig på forbrugerhardware.

Summary

Quantized Low-Rank Adaptation, en metode til effektiv finjustering af store sprogmodeller ved hjælp af 4-bit-kvantisering og lav-rang adaptere.

Key Concepts

  • Low-Rank Adaptation
  • 4-bit-kvantisering
  • Hukommelseseffektivitet
  • Finjustering

Use Cases

  • Finjustering på forbruger-GPU’er
  • Ressourcebegrænsede miljøer
  • Hurtig modeliteration

Code Example

1
2
3
from peft import LoraConfig, get_peft_model
config = LoraConfig(r=8, lora_alpha=32, target_modules=["q_proj", "v_proj"])
model = get_peft_model(base_model, config)