对齐

term_id: alignment

Category: ethics_safety

Definition

对齐关注的是确保 AI 系统执行人类真正希望它做的事情,而不仅仅是字面上要求它做的事。它涉及诸如来自人类反馈的强化学习(RLHF)等技术,旨在缩小模型输出与人类期望之间的差距,提高安全性和有用性。

Summary

确保 AI 系统的目标和行为与人类价值观及意图相一致的过程。

Key Concepts

  • RLHF (来自人类反馈的强化学习)
  • 价值加载
  • 意图匹配
  • 奖励建模

Use Cases

  • 调整聊天机器人的礼貌程度
  • 确保摘要的事实准确性
  • 防止越狱攻击利用