Versterkend Leren uit Menselijke Feedback

term_id: rlhf

Category: training_techniques

Definition

Versterkend Leren uit Menselijke Feedback (RLHF) is een methode die wordt gebruikt om grote taalmodellen te finetunen zodat hun uitvoeringen beter aansluiten bij menselijke waarden en verwachtingen. Het omvat doorgaans drie stappen:

Summary

RLHF is een techniek die AI-modellen afstemt op menselijke voorkeuren door menselijke feedback te gebruiken om een beloningsmodel te trainen voor versterkend leren.

Key Concepts

  • Voorkeursgegevens
  • Beloningsmodel
  • Afstemming (Alignment)
  • PPO (Proximale Beleidsoptimalisatie)

Use Cases

  • Chatbot-verfijning
  • Inhoudsmoderatie
  • Verbetering van instructienavolging