宪法人工智能

term_id: constitutional_ai

Category: application_paradigms

Definition

宪法人工智能是一种框架,旨在使大型语言模型与人类价值观保持一致,而无需在每个步骤都完全依赖人类反馈。它涉及创建一套高层级的“宪法”原则,让模型根据这些原则进行自我修正和对齐。

Summary

一种通过基于预定义原则的自我批评,训练人工智能模型遵循安全指南的方法。

Key Concepts

  • 自我纠正
  • 对齐
  • 基于原则的训练
  • RLHF替代方案

Use Cases

  • 减少大语言模型中的有害输出
  • 提高模型的有用性和诚实度
  • 高效扩展安全训练