LLM-as-a-Judge

term_id: llm_as_a_judge

Category: application_paradigms

Definition

LLM-as-a-Judgeは、大規模言語モデルが他のモデルからの出力品質に対する自動評価者として機能する評価パラダイムです。人間の注釈担当者や厳格なルールだけに依存するのではなく、

Summary

別のLLMを使用して、基準に対して回答をスコアリングまたはランク付けすることで、大規模言語モデルの出力を評価する方法。

Key Concepts

  • 自動評価
  • プロンプトエンジニアリング
  • モデルアライメント
  • 品質指標

Use Cases

  • RLHFモデルのベンチマーク
  • クリエイティブライティングの評価
  • 安全性とバイアスの検出