Penyelarasan

term_id: alignment

Category: ethics_safety

Definition

Penyelarasan berfokus pada memastikan sistem AI melakukan apa yang sebenarnya diinginkan manusia, bukan sekadar apa yang secara harfiah diminta. Hal ini melibatkan teknik seperti Reinforcement Learning from Human Feedback (RLHF) untuk menyelaraskan output model.

Summary

Proses memastikan bahwa tujuan dan perilaku sistem AI sesuai dengan nilai dan niat manusia.

Key Concepts

  • RLHF (Reinforcement Learning from Human Feedback)
  • Pemuatan nilai
  • Pencocokan niat
  • Pemodelan hadiah

Use Cases

  • Menyetel chatbot agar lebih sopan
  • Memastikan akurasi faktual dalam ringkasan
  • Mencegah eksploitasi jailbreak