QLoRA

term_id: qlora

Category: training_techniques

Definition

Το QLoRA συνδυάζει την Προσαρμογή Χαμηλού Βαθμού (LoRA) με κβάντιση 4-bit για να μειώσει σημαντικά το αποτύπωμα μνήμης που απαιτείται για την προσαρμογή μαζικών μοντέλων. Αποθηκεύοντας τα βάρη σε μορφή 4-bit και προσθέτοντας μικρούς προσαρμογείς, επιτυγχάνεται υψηλή απόδοση με περιορισμένους πόρους.

Summary

Quantized Low-Rank Adaptation, μια μέθοδος για την αποδοτική προσαρμογή μεγάλων γλωσσικών μοντέλων χρησιμοποιώντας κβάντιση 4-bit και προσαρμογείς χαμηλού βαθμού.

Key Concepts

  • Προσαρμογή Χαμηλού Βαθμού
  • Κβάντιση 4-Bit
  • Απόδοση Μνήμης
  • Εξατομίκευση Μοντέλου

Use Cases

  • Εξατομίκευση σε Καταναλωτικές GPU
  • Περιβάλλοντα Περιορισμένων Πόρων
  • Γρήγορη Επανάληψη Μοντέλων

Code Example

1
2
3
from peft import LoraConfig, get_peft_model
config = LoraConfig(r=8, lora_alpha=32, target_modules=["q_proj", "v_proj"])
model = get_peft_model(base_model, config)