QLoRA

term_id: qlora

Category: training_techniques

Definition

O QLoRA combina a Adaptação de Baixo Ranque (LoRA) com a quantização de 4 bits para reduzir significativamente a pegada de memória necessária para o ajuste fino de modelos massivos. Ao armazenar os pesos no formato de 4 bits e adicionar adaptadores…

Summary

Adaptação de Baixo Ranque Quantizada, um método para ajustar finamente grandes modelos de linguagem de forma eficiente, utilizando quantização de 4 bits e adaptadores de baixo ranque.

Key Concepts

  • Adaptação de Baixo Ranque
  • Quantização de 4 Bits
  • Eficiência de Memória
  • Ajuste Fino

Use Cases

  • Ajuste Fino em GPUs de Consumo
  • Ambientes com Recursos Limitados
  • Iteração Rápida de Modelos

Code Example

1
2
3
from peft import LoraConfig, get_peft_model
config = LoraConfig(r=8, lora_alpha=32, target_modules=["q_proj", "v_proj"])
model = get_peft_model(base_model, config)