LLM-as-a-Judge
term_id: llm_as_a_judge
Category: application_paradigms
Definition
LLM-as-a-Judge는 대형 언어 모델이 다른 모델들의 출력 품질에 대한 자동 평가자 역할을 수행하는 평가 패러다임입니다. 이는 전적으로 인간 애노테이터나 규칙 기반 시스템에만 의존하는 대신, LLM을 평가 도구로 활용합니다.
Summary
다른 대형 언어 모델(LLM)을 사용하여 기준에 따라 응답을 채점하거나 순위 매김함으로써 LLM 출력을 평가하는 방법론입니다.
Key Concepts
- 자동 평가(Automated Evaluation)
- 프롬프트 엔지니어링(Prompt Engineering)
- 모델 정렬(Model Alignment)
- 품질 지표(Quality Metrics)
Use Cases
- RLHF 모델 벤치마킹
- 창작 글쓰기 평가
- 안전성 및 편향 감지