QLoRA
term_id: qlora
Category: training_techniques
Definition
Το QLoRA συνδυάζει την Προσαρμογή Χαμηλού Βαθμού (LoRA) με κβάντιση 4-bit για να μειώσει σημαντικά το αποτύπωμα μνήμης που απαιτείται για την προσαρμογή μαζικών μοντέλων. Αποθηκεύοντας τα βάρη σε μορφή 4-bit και προσθέτοντας μικρούς προσαρμογείς, επιτυγχάνεται υψηλή απόδοση με περιορισμένους πόρους.
Summary
Quantized Low-Rank Adaptation, μια μέθοδος για την αποδοτική προσαρμογή μεγάλων γλωσσικών μοντέλων χρησιμοποιώντας κβάντιση 4-bit και προσαρμογείς χαμηλού βαθμού.
Key Concepts
- Προσαρμογή Χαμηλού Βαθμού
- Κβάντιση 4-Bit
- Απόδοση Μνήμης
- Εξατομίκευση Μοντέλου
Use Cases
- Εξατομίκευση σε Καταναλωτικές GPU
- Περιβάλλοντα Περιορισμένων Πόρων
- Γρήγορη Επανάληψη Μοντέλων
Code Example
from peft import LoraConfig, get_peft_model
config = LoraConfig(r=8, lora_alpha=32, target_modules=["q_proj", "v_proj"])
model = get_peft_model(base_model, config)