QLoRA
term_id: qlora
Category: training_techniques
Definition
QLoRA kombiniert Low-Rank Adaptation (LoRA) mit 4-Bit-Quantisierung, um den Speicherbedarf für die Feinabstimmung massiver Modelle erheblich zu reduzieren. Durch die Speicherung der Gewichte im 4-Bit-Format und das Hinzufügen kleiner Adaptermatrizen wird Effizienz erzielt.
Summary
Quantized Low-Rank Adaptation, eine Methode zur effizienten Feinabstimmung großer Sprachmodelle unter Verwendung von 4-Bit-Quantisierung und Low-Rank-Adaptern.
Key Concepts
- Low-Rank Adaptation
- 4-Bit-Quantisierung
- Speichereffizienz
- Feinabstimmung
Use Cases
- Feinabstimmung auf Consumer-GPUs
- Ressourcenbeschränkte Umgebungen
- Schnelle Modellanpassung
Code Example
from peft import LoraConfig, get_peft_model
config = LoraConfig(r=8, lora_alpha=32, target_modules=["q_proj", "v_proj"])
model = get_peft_model(base_model, config)