LLM-as-a-Judge
term_id: llm_as_a_judge
Category: application_paradigms
Definition
LLM-as-a-Judge is een evaluatieparadigma waarbij een groot taalmodel fungeert als een geautomatiseerde evaluator voor de kwaliteit van de uitvoer van andere modellen. In plaats van uitsluitend te vertrouwen op menselijke annotators of rigide regelgebaseerde metrics, wordt een trainbaar LLM gebruikt om de coherentie, nauwkeurigheid en veiligheid van gegenereerde tekst te beoordelen. Dit maakt schaalbare en contextbewuste evaluatie mogelijk.
Summary
Een methode voor het evalueren van de uitvoer van grote taalmodellen door een ander LLM te gebruiken om antwoorden te scoren of rangschikken op basis van criteria.
Key Concepts
- Geautomatiseerde evaluatie
- Prompt engineering
- Modelalignement
- Kwaliteitsmetrics
Use Cases
- Benchmarking van RLHF-modellen
- Evalueren van creatief schrijven
- Detectie van veiligheidsrisico’s en bias