Hizalama
term_id: alignment
Category: ethics_safety
Definition
Hizalama, yapay zeka sistemlerinin sadece kelime anlamıyla istenen şeyi değil, insanların gerçekten istediği şeyi yapmasını sağlamaya odaklanır. İnsan Geri Bildirimli Pekiştirmeli Öğrenme (RLHF) gibi teknikleri içerir.
Summary
Bir yapay zeka sisteminin amaç ve davranışlarının insan değerleri ve niyetleriyle uyumlu hale getirilme süreci.
Key Concepts
- RLHF (İnsan Geri Bildirimli Pekiştirmeli Öğrenme)
- Değer yükleme
- Niyet eşleştirme
- Ödül modelleme
Use Cases
- Sohbet botlarının nezaket için ayarlanması
- Özetlerde gerçeklik doğruluğunun sağlanması
- Jailbreak (hile) sömürülerinin önlenmesi