QLoRA

term_id: qlora

Category: training_techniques

Definition

QLoRA kombiniert Low-Rank Adaptation (LoRA) mit 4-Bit-Quantisierung, um den Speicherbedarf für die Feinabstimmung massiver Modelle erheblich zu reduzieren. Durch die Speicherung der Gewichte im 4-Bit-Format und das Hinzufügen kleiner Adaptermatrizen wird Effizienz erzielt.

Summary

Quantized Low-Rank Adaptation, eine Methode zur effizienten Feinabstimmung großer Sprachmodelle unter Verwendung von 4-Bit-Quantisierung und Low-Rank-Adaptern.

Key Concepts

  • Low-Rank Adaptation
  • 4-Bit-Quantisierung
  • Speichereffizienz
  • Feinabstimmung

Use Cases

  • Feinabstimmung auf Consumer-GPUs
  • Ressourcenbeschränkte Umgebungen
  • Schnelle Modellanpassung

Code Example

1
2
3
from peft import LoraConfig, get_peft_model
config = LoraConfig(r=8, lora_alpha=32, target_modules=["q_proj", "v_proj"])
model = get_peft_model(base_model, config)