LLM-as-a-Judge

term_id: llm_as_a_judge

Category: application_paradigms

Definition

LLM-as-a-Judge är ett utvärderingsparadigm där en stor språkmodell fungerar som en automatisk utvärderare av kvaliteten på output från andra modeller. Istället för att enbart förlita sig på mänskliga annotatörer eller fasta regelverk, använder denna metod språkmodellens förmåga att förstå nyanser och kontext för att ge kvalificerade omdömen om svar.

Summary

En metod för att utvärdera output från stora språkmodeller genom att använda en annan LLM för att betygsätta eller rangordna svar mot kriterier.

Key Concepts

  • Automatisk utvärdering
  • Prompt-engineering
  • Modelljustering
  • Kvalitetsmått

Use Cases

  • Benchmarking av RLHF-modeller
  • Utvärdering av kreativt skrivande
  • Detektering av säkerhetsrisker och bias