QLoRA

term_id: qlora

Category: training_techniques

Definition

QLoRA combine l’adaptation de faible rang (LoRA) avec une quantification 4 bits pour réduire considérablement l’empreinte mémoire requise pour le peaufinage de modèles massifs. En stockant les poids au format 4 bits et en ajoutant des adaptateurs de faible rang…

Summary

Low-Rank Adaptation Quantifié, une méthode permettant de peaufiner efficacement les grands modèles de langage en utilisant une quantification 4 bits et des adaptateurs de faible rang.

Key Concepts

  • Adaptation de Faible Rang
  • Quantification 4 Bits
  • Efficacité Mémoire
  • Pefaunage (Fine-Tuning)

Use Cases

  • Pefaunage sur GPU Grand Public
  • Environnements à Ressources Limitées
  • Itération Rapide de Modèles

Code Example

1
2
3
from peft import LoraConfig, get_peft_model
config = LoraConfig(r=8, lora_alpha=32, target_modules=["q_proj", "v_proj"])
model = get_peft_model(base_model, config)