Penyelarasan AI

term_id: ai_alignment

Category: ethics_safety

Definition

Penyelarasan AI menangani tantangan membuat sistem kecerdasan buatan melakukan apa yang dimaksudkan pengguna secara robust, bukan sekadar apa yang secara harfiah mereka spesifikasikan. Hal ini melibatkan metode teknis untuk memastikan bahwa perilaku AI selaras dengan kepentingan dan etika manusia.

Summary

Bidang studi yang berfokus pada memastikan sistem AI berperilaku sesuai dengan nilai dan niat manusia.

Key Concepts

  • pembelajaran nilai
  • perilaku bermanfaat
  • masalah kontrol
  • interpretabilitas

Use Cases

  • Riset keamanan dalam model bahasa besar
  • Pengembangan fungsi hadiah untuk RLHF
  • Implementasi pedoman etika