Învățare prin Consolidare din Feedback Uman
term_id: rlhf
Category: training_techniques
Definition
Învățarea prin Consolidare din Feedback Uman (RLHF) este o metodă utilizată pentru a ajusta modelele mari de limbaj astfel încât ieșirile lor să se alinieze mai bine cu valorile și așteptările umane. De obicei, implică trei pași
Summary
RLHF este o tehnică care aliniază modelele de IA cu preferințele umane folosind feedback-ul uman pentru a antrena un model de recompensă pentru învățarea prin consolidare.
Key Concepts
- Date de Preferință
- Model de Recompensă
- Aliniere
- PPO (Optimizarea Proximală a Politicii)
Use Cases
- Rafinarea chatboților
- Moderarea conținutului
- Îmbunătățirea respectării instrucțiunilor