好み学習

term_id: preference_learning

Category: training_techniques

Definition

好み学習は、絶対的なラベルではなく人間の判断に基づいて、良い出力と悪い出力を区別できるようにモデルを教育することに焦点を当てています。通常、特定の入力が与えられた際に複数の応答の中からより好ましいものを選ぶようなペアの応答データを収集し、それらの好みから報酬モデルを学習します。これにより、モデルの動作を人間の価値観や意図に合わせることができます。

Summary

比較フィードバックを用いて、モデルの出力を人間の好みに適合させるための技術。

Key Concepts

  • 人間のフィードバック
  • ペアワイズ比較
  • 報酬モデリング
  • アライメント

Use Cases

  • LLMにおけるRLHF(人間のフィードバックによる強化学習)
  • レコメンデーションシステム
  • コンテンツモデレーションフィルタリング