İnsan Geri Bildiriminden Güçlendirilmiş Öğrenme

term_id: rlhf

Category: training_techniques

Definition

İnsan Geri Bildiriminden Güçlendirilmiş Öğrenme (RLHF), büyük dil modellerinin çıktılarını insan değerleri ve beklentileriyle daha iyi hizalamak için kullanılan bir yöntemdir. Genellikle üç adımdan oluşur: birincisi denetimli ince ayar, ikincisi insan tercih verileriyle bir ödül modelinin eğitilmesi ve son olarak bu ödül modelini kullanarak politikanın güçlendirilmiş öğrenme ile optimize edilmesi.

Summary

RLHF, insan geri bildirimlerini kullanarak bir ödül modeli eğitmek suretiyle yapay zeka modellerini insan tercihleriyle hizalayarak uyumlu hale getiren bir tekniktir.

Key Concepts

  • Tercih Verisi
  • Ödül Modeli
  • Hizalama
  • PPO (Yakın Politika Optimizasyonu)

Use Cases

  • Sohbet botlarının iyileştirilmesi
  • İçerik moderasyonu
  • Talimatları takip etme yeteneğini artırma