Reinforcement Learning from Human Feedback
term_id: rlhf
Category: training_techniques
Definition
Reinforcement Learning from Human Feedback (RLHF) adalah metode yang digunakan untuk menyetel ulang model bahasa besar agar outputnya lebih selaras dengan nilai dan harapan manusia. Metode ini biasanya melibatkan tiga langkah…
Summary
RLHF adalah teknik yang menyelaraskan model AI dengan preferensi manusia dengan menggunakan umpan balik manusia untuk melatih model hadiah bagi pembelajaran penguatan.
Key Concepts
- Data Preferensi
- Model Hadiah
- Penyelarasan
- PPO (Optimisasi Kebijakan Proksimal)
Use Cases
- Perhalusan chatbot
- Moderasi konten
- Meningkatkan kepatuhan terhadap instruksi