Reinforcement Learning from Human Feedback

term_id: rlhf

Category: training_techniques

Definition

Reinforcement Learning from Human Feedback (RLHF) adalah metode yang digunakan untuk menyetel ulang model bahasa besar agar outputnya lebih selaras dengan nilai dan harapan manusia. Metode ini biasanya melibatkan tiga langkah…

Summary

RLHF adalah teknik yang menyelaraskan model AI dengan preferensi manusia dengan menggunakan umpan balik manusia untuk melatih model hadiah bagi pembelajaran penguatan.

Key Concepts

  • Data Preferensi
  • Model Hadiah
  • Penyelarasan
  • PPO (Optimisasi Kebijakan Proksimal)

Use Cases

  • Perhalusan chatbot
  • Moderasi konten
  • Meningkatkan kepatuhan terhadap instruksi