İnsan Geri Bildiriminden Güçlendirilmiş Öğrenme
term_id: rlhf
Category: training_techniques
Definition
İnsan Geri Bildiriminden Güçlendirilmiş Öğrenme (RLHF), büyük dil modellerinin çıktılarını insan değerleri ve beklentileriyle daha iyi hizalamak için kullanılan bir yöntemdir. Genellikle üç adımdan oluşur: birincisi denetimli ince ayar, ikincisi insan tercih verileriyle bir ödül modelinin eğitilmesi ve son olarak bu ödül modelini kullanarak politikanın güçlendirilmiş öğrenme ile optimize edilmesi.
Summary
RLHF, insan geri bildirimlerini kullanarak bir ödül modeli eğitmek suretiyle yapay zeka modellerini insan tercihleriyle hizalayarak uyumlu hale getiren bir tekniktir.
Key Concepts
- Tercih Verisi
- Ödül Modeli
- Hizalama
- PPO (Yakın Politika Optimizasyonu)
Use Cases
- Sohbet botlarının iyileştirilmesi
- İçerik moderasyonu
- Talimatları takip etme yeteneğini artırma