LLM-as-a-Judge

term_id: llm_as_a_judge

Category: application_paradigms

Definition

LLM-as-a-Judge è un paradigma di valutazione in cui un modello linguistico di grandi dimensioni funge da valutatore automatizzato per la qualità degli output di altri modelli. Invece di affidarsi esclusivamente ad annotatori umani o metriche rigide, questo approccio sfrutta la capacità degli LLM di comprendere il linguaggio naturale e di giudicare la coerenza, la rilevanza e la sicurezza delle risposte generate.

Summary

Un metodo per valutare gli output dei modelli linguistici di grandi dimensioni (LLM) utilizzando un altro LLM per assegnare punteggi o classificare le risposte in base a criteri specifici.

Key Concepts

  • Valutazione automatizzata
  • Ingegneria dei prompt
  • Allineamento del modello
  • Metriche di qualità

Use Cases

  • Benchmarking di modelli RLHF
  • Valutazione della scrittura creativa
  • Rilevamento di sicurezza e pregiudizi