LLM som dommer
term_id: llm_as_a_judge
Category: application_paradigms
Definition
LLM som dommer er en evalueringsparadigme, hvor en stor sprogmodel fungerer som en automatisk evaluator for kvaliteten af output fra andre modeller. I stedet for kun at stole på menneskelige annotatorer eller rigtige
Summary
En metode til evaluering af output fra store sprogmodeller ved at bruge en anden LLM til at vurdere eller rangere svar baseret på kriterier.
Key Concepts
- Automatiseret evaluering
- Prompt-engineering
- Modeltilpasning
- Kvalitetsmetrikker
Use Cases
- Benchmarking af RLHF-modeller
- Evaluering af kreativ skrivning
- Detektion af sikkerhedsrisici og bias