LLM sebagai Hakim
term_id: llm_as_a_judge
Category: application_paradigms
Definition
LLM-as-a-Judge adalah paradigma evaluasi di mana sebuah Model Bahasa Besar (LLM) berfungsi sebagai evaluator otomatis untuk kualitas keluaran dari model-model lain. Alih-alih hanya mengandalkan anotator manusia atau metrik teks yang kaku, pendekatan ini menggunakan LLM untuk menilai respons berdasarkan kriteria seperti koherensi, kebenaran faktual, atau keamanan. Metode ini semakin populer karena skalabilitas dan biayanya yang lebih rendah dibandingkan evaluasi manual.
Summary
Metode untuk mengevaluasi keluaran Model Bahasa Besar dengan menggunakan Model Bahasa Besar lain untuk memberi skor atau peringkat respons berdasarkan kriteria tertentu.
Key Concepts
- Evaluasi Otomatis
- Rekayasa Prompt
- Penyelarasan Model
- Metrik Kualitas
Use Cases
- Benchmarking model RLHF
- Mengevaluasi tulisan kreatif
- Deteksi keamanan dan bias