Penyelarasan
term_id: alignment
Category: ethics_safety
Definition
Penyelarasan berfokus pada memastikan sistem AI melakukan apa yang sebenarnya diinginkan manusia, bukan sekadar apa yang secara harfiah diminta. Hal ini melibatkan teknik seperti Reinforcement Learning from Human Feedback (RLHF) untuk menyelaraskan output model.
Summary
Proses memastikan bahwa tujuan dan perilaku sistem AI sesuai dengan nilai dan niat manusia.
Key Concepts
- RLHF (Reinforcement Learning from Human Feedback)
- Pemuatan nilai
- Pencocokan niat
- Pemodelan hadiah
Use Cases
- Menyetel chatbot agar lebih sopan
- Memastikan akurasi faktual dalam ringkasan
- Mencegah eksploitasi jailbreak