Învățare prin Consolidare din Feedback Uman

term_id: rlhf

Category: training_techniques

Definition

Învățarea prin Consolidare din Feedback Uman (RLHF) este o metodă utilizată pentru a ajusta modelele mari de limbaj astfel încât ieșirile lor să se alinieze mai bine cu valorile și așteptările umane. De obicei, implică trei pași

Summary

RLHF este o tehnică care aliniază modelele de IA cu preferințele umane folosind feedback-ul uman pentru a antrena un model de recompensă pentru învățarea prin consolidare.

Key Concepts

  • Date de Preferință
  • Model de Recompensă
  • Aliniere
  • PPO (Optimizarea Proximală a Politicii)

Use Cases

  • Rafinarea chatboților
  • Moderarea conținutului
  • Îmbunătățirea respectării instrucțiunilor