安全性

term_id: safety

Category: ethics_safety

Definition

AI安全性是一个多学科领域,专注于防止先进人工智能带来的不良后果。它涵盖了对齐、可解释性和鲁棒性等技术挑战,以及治理框架的开发。

Summary

研究和实践确保AI系统不造成物理、数字或社会危害的领域。

Key Concepts

  • 价值对齐
  • 可解释性
  • 控制理论
  • 风险评估

Use Cases

  • 为自动驾驶汽车开发紧急制动开关
  • 审计算法中的偏见
  • 创建AI部署的监管框架