Penyelarasan AI
term_id: ai_alignment
Category: ethics_safety
Definition
Penyelarasan AI menangani tantangan membuat sistem kecerdasan buatan melakukan apa yang dimaksudkan pengguna secara robust, bukan sekadar apa yang secara harfiah mereka spesifikasikan. Hal ini melibatkan metode teknis untuk memastikan bahwa perilaku AI selaras dengan kepentingan dan etika manusia.
Summary
Bidang studi yang berfokus pada memastikan sistem AI berperilaku sesuai dengan nilai dan niat manusia.
Key Concepts
- pembelajaran nilai
- perilaku bermanfaat
- masalah kontrol
- interpretabilitas
Use Cases
- Riset keamanan dalam model bahasa besar
- Pengembangan fungsi hadiah untuk RLHF
- Implementasi pedoman etika