AI 对齐

term_id: ai_alignment

Category: ethics_safety

Definition

AI 对齐旨在解决如何让人工智能系统稳健地执行用户真正意图的任务,而非仅仅字面指定的任务。它涉及确保系统行为有益的技术方法。

Summary

致力于确保 AI 系统行为符合人类价值观和意图的研究领域。

Key Concepts

  • 价值学习
  • 有益行为
  • 控制问题
  • 可解释性

Use Cases

  • 大型语言模型的安全研究
  • 开发 RLHF 的奖励函数
  • 伦理准则的实施