QLoRA

term_id: qlora

Category: training_techniques

Definition

QLoRA menggabungkan Low-Rank Adaptation (LoRA) dengan kuantisasi 4-bit untuk secara signifikan mengurangi jejak memori yang diperlukan untuk menyetel ulang model besar. Dengan menyimpan bobot dalam format 4-bit dan menambahkan adapter berderajat rendah, metode ini memungkinkan fine-tuning pada perangkat dengan sumber daya terbatas.

Summary

Quantized Low-Rank Adaptation, sebuah metode untuk menyetel ulang (fine-tuning) model bahasa besar secara efisien menggunakan kuantisasi 4-bit dan adapter berderajat rendah.

Key Concepts

  • Adaptasi Berderajat Rendah (Low-Rank Adaptation)
  • Kuantisasi 4-Bit
  • Efisiensi Memori
  • Penyetelan Ulang (Fine-Tuning)

Use Cases

  • Fine-Tuning pada GPU Konsumen
  • Lingkungan dengan Sumber Daya Terbatas
  • Iterasi Model yang Cepat

Code Example

1
2
3
from peft import LoraConfig, get_peft_model
config = LoraConfig(r=8, lora_alpha=32, target_modules=["q_proj", "v_proj"])
model = get_peft_model(base_model, config)