Versterkend Leren uit Menselijke Feedback
term_id: rlhf
Category: training_techniques
Definition
Versterkend Leren uit Menselijke Feedback (RLHF) is een methode die wordt gebruikt om grote taalmodellen te finetunen zodat hun uitvoeringen beter aansluiten bij menselijke waarden en verwachtingen. Het omvat doorgaans drie stappen:
Summary
RLHF is een techniek die AI-modellen afstemt op menselijke voorkeuren door menselijke feedback te gebruiken om een beloningsmodel te trainen voor versterkend leren.
Key Concepts
- Voorkeursgegevens
- Beloningsmodel
- Afstemming (Alignment)
- PPO (Proximale Beleidsoptimalisatie)
Use Cases
- Chatbot-verfijning
- Inhoudsmoderatie
- Verbetering van instructienavolging