LLM som dommer
term_id: llm_as_a_judge
Category: application_paradigms
Definition
LLM-as-a-Judge er en evalueringsparadigme der en stor språkmodell fungerer som en automatisk evaluator for kvaliteten på output fra andre modeller. I stedet for å stole utelukkende på menneskelige annotatører eller strenge regelbaserte mål, gir LLM-en semantisk forståelse og kontekstuell vurdering av svarenes kvalitet.
Summary
En metode for å evaluere output fra store språkmodeller ved å bruke en annen LLM til å vurdere eller rangere svar mot kriterier.
Key Concepts
- Automatisert evaluering
- Prompt-engineering
- Modelltilpasning
- Kvalitetsmetrikker
Use Cases
- Benchmarking av RLHF-modeller
- Evaluering av kreativ skriving
- Oppdagelse av sikkerhetsrisikoer og fordommer