LLM sebagai Hakim

term_id: llm_as_a_judge

Category: application_paradigms

Definition

LLM-as-a-Judge adalah paradigma evaluasi di mana sebuah Model Bahasa Besar (LLM) berfungsi sebagai evaluator otomatis untuk kualitas keluaran dari model-model lain. Alih-alih hanya mengandalkan anotator manusia atau metrik teks yang kaku, pendekatan ini menggunakan LLM untuk menilai respons berdasarkan kriteria seperti koherensi, kebenaran faktual, atau keamanan. Metode ini semakin populer karena skalabilitas dan biayanya yang lebih rendah dibandingkan evaluasi manual.

Summary

Metode untuk mengevaluasi keluaran Model Bahasa Besar dengan menggunakan Model Bahasa Besar lain untuk memberi skor atau peringkat respons berdasarkan kriteria tertentu.

Key Concepts

  • Evaluasi Otomatis
  • Rekayasa Prompt
  • Penyelarasan Model
  • Metrik Kualitas

Use Cases

  • Benchmarking model RLHF
  • Mengevaluasi tulisan kreatif
  • Deteksi keamanan dan bias