QLoRA

term_id: qlora

Category: training_techniques

Definition

QLoRA combina l’Adattamento a Basso Rango (LoRA) con la quantizzazione a 4 bit per ridurre significativamente l’impronta di memoria richiesta per l’ottimizzazione fine di modelli massicci. Memorizzando i pesi in formato a 4 bit e aggiungendo adapter a basso rango…

Summary

Quantized Low-Rank Adaptation, un metodo per ottimizzare efficientemente i grandi modelli linguistici utilizzando la quantizzazione a 4 bit e adapter a basso rango.

Key Concepts

  • Adattamento a Basso Rango
  • Quantizzazione a 4 Bit
  • Efficienza di Memoria
  • Ottimizzazione Fine

Use Cases

  • Ottimizzazione Fine su GPU Consumer
  • Ambienti con Risorse Limitate
  • Iterazione Rapida dei Modelli

Code Example

1
2
3
from peft import LoraConfig, get_peft_model
config = LoraConfig(r=8, lora_alpha=32, target_modules=["q_proj", "v_proj"])
model = get_peft_model(base_model, config)