LLM som dommer

term_id: llm_as_a_judge

Category: application_paradigms

Definition

LLM som dommer er en evalueringsparadigme, hvor en stor sprogmodel fungerer som en automatisk evaluator for kvaliteten af output fra andre modeller. I stedet for kun at stole på menneskelige annotatorer eller rigtige

Summary

En metode til evaluering af output fra store sprogmodeller ved at bruge en anden LLM til at vurdere eller rangere svar baseret på kriterier.

Key Concepts

  • Automatiseret evaluering
  • Prompt-engineering
  • Modeltilpasning
  • Kvalitetsmetrikker

Use Cases

  • Benchmarking af RLHF-modeller
  • Evaluering af kreativ skrivning
  • Detektion af sikkerhedsrisici og bias