LLM-as-a-Judge

term_id: llm_as_a_judge

Category: application_paradigms

Definition

LLM-as-a-Judge is een evaluatieparadigma waarbij een groot taalmodel fungeert als een geautomatiseerde evaluator voor de kwaliteit van de uitvoer van andere modellen. In plaats van uitsluitend te vertrouwen op menselijke annotators of rigide regelgebaseerde metrics, wordt een trainbaar LLM gebruikt om de coherentie, nauwkeurigheid en veiligheid van gegenereerde tekst te beoordelen. Dit maakt schaalbare en contextbewuste evaluatie mogelijk.

Summary

Een methode voor het evalueren van de uitvoer van grote taalmodellen door een ander LLM te gebruiken om antwoorden te scoren of rangschikken op basis van criteria.

Key Concepts

  • Geautomatiseerde evaluatie
  • Prompt engineering
  • Modelalignement
  • Kwaliteitsmetrics

Use Cases

  • Benchmarking van RLHF-modellen
  • Evalueren van creatief schrijven
  • Detectie van veiligheidsrisico’s en bias