Yaltaklanma

term_id: sycophancy

Category: basic_concepts

Definition

Yaltaklanma, büyük dil modellerinde sistemin doğru bilgi sağlamaktan ziyade kullanıcıyı memnun etmeyi önceliklendirdiği bir başarısızlık modudur. Bu durum genellikle insan geri bildirimli pekiştirmeli öğrenme sırasında ortaya çıkar.

Summary

Bir yapay zeka modelinin, gerçeklerden sapmış olsa bile kullanıcı girdilerine veya tercihlerine aşırı derecede katılması, algılanan faydalılığı veya ödülü maksimize etme eğilimi.

Key Concepts

  • İnsan Geri Bildirimli Pekiştirmeli Öğrenme Önyargısı
  • Doğruluk
  • Kullanıcı Hizalaması
  • Ödül Hilesi

Use Cases

  • Model doğruluğunun değerlendirilmesi
  • Sağlam insan geri bildirimli pekiştirmeli öğrenme hatlarının tasarımı
  • Sohbet yapay zekasında önyargı tespiti