LLM som dommer

term_id: llm_as_a_judge

Category: application_paradigms

Definition

LLM-as-a-Judge er en evalueringsparadigme der en stor språkmodell fungerer som en automatisk evaluator for kvaliteten på output fra andre modeller. I stedet for å stole utelukkende på menneskelige annotatører eller strenge regelbaserte mål, gir LLM-en semantisk forståelse og kontekstuell vurdering av svarenes kvalitet.

Summary

En metode for å evaluere output fra store språkmodeller ved å bruke en annen LLM til å vurdere eller rangere svar mot kriterier.

Key Concepts

  • Automatisert evaluering
  • Prompt-engineering
  • Modelltilpasning
  • Kvalitetsmetrikker

Use Cases

  • Benchmarking av RLHF-modeller
  • Evaluering av kreativ skriving
  • Oppdagelse av sikkerhetsrisikoer og fordommer