アライメント

term_id: alignment

Category: ethics_safety

Definition

アライメントは、AIシステムが文字通り求められたことだけでなく、人間が本当に望んでいることを実行するようにすることを重視します。これには、人間のフィードバックによる強化学習(RLHF)などの手法が含まれます。

Summary

AIシステムの目的や行動が人間の価値観や意図と一致するようにするプロセス。

Key Concepts

  • RLHF (人間のフィードバックによる強化学習)
  • バリューローディング
  • 意図の一致
  • 報酬モデリング

Use Cases

  • チャットボットの礼儀正しさの調整
  • 要約における事実の正確性の確保
  • ジェイルブレイク攻撃の防止