憲章型AI

term_id: constitutional_ai

Category: application_paradigms

Definition

憲章型AIは、すべてのステップで人間のフィードバックに依存することなく、大規模言語モデルを人間の価値観と整合させるためのフレームワークです。これは、高レベルの原則からなる「憲章」を作成し、モデルがその原則に基づいて自己修正・自己評価を行うプロセスを含みます。

Summary

事前に定義された原則に基づいた自己批判を通じて、AIモデルが安全ガイドラインに従うように訓練する方法。

Key Concepts

  • 自己修正
  • アライメント(価値観の整合)
  • 原則ベースのトレーニング
  • RLHFの代替手法

Use Cases

  • LLMにおける有害出力の削減
  • モデルの有用性と誠実性の向上
  • 安全トレーニングのスケーラブルな効率化