Pembelajaran preferensi
term_id: preference_learning
Category: training_techniques
Definition
Pembelajaran preferensi berfokus pada pengajaran model untuk membedakan antara keluaran yang baik dan buruk berdasarkan penilaian manusia, bukan label absolut. Teknik ini biasanya melibatkan pengumpulan pasangan respons di mana manusia memilih yang lebih disukai, yang kemudian digunakan untuk melatih model reward atau fungsi utilitas. Pendekatan ini sangat penting dalam menyelaraskan perilaku model AI dengan nilai-nilai dan keinginan manusia.
Summary
Teknik yang melatih model untuk menyelaraskan keluaran dengan preferensi manusia menggunakan umpan balik komparatif.
Key Concepts
- Umpan balik manusia
- Perbandingan berpasangan
- Pemodelan reward
- Penyelarasan (Alignment)
Use Cases
- RLHF untuk Model Bahasa Besar (LLM)
- Sistem rekomendasi
- Filtering moderasi konten