Multi-armed bandit
term_id: multi_armed_bandit
Category: basic_concepts
Definition
Masalah multi-armed bandit menggambarkan dilema yang dihadapi oleh agen yang memutuskan apakah akan tetap memilih opsi yang sudah diketahui memberikan imbalan (eksploitasi) atau mencoba opsi baru untuk menemukan imbalan yang mungkin lebih baik
Summary
Masalah multi-armed bandit adalah masalah klasik dalam teori probabilitas dan pembelajaran penguatan yang memodelkan pertukaran antara eksplorasi dan eksploitasi.
Key Concepts
- Eksplorasi vs Eksploitasi
- Maksimalisasi Imbalan
- Proses Stokastik
- Minimisasi Regret
Use Cases
- Optimasi pengujian A/B
- Sistem rekomendasi
- Strategi penempatan iklan
Related Terms
- Reinforcement Learning (Jenis pembelajaran mesin di mana agen belajar melalui interaksi dengan lingkungan)
- Epsilon-Greedy (Strategi sederhana untuk menyeimbangkan eksplorasi dan eksploitasi)
- Contextual Bandits (Variasi masalah bandit yang memperhitungkan konteks atau fitur tambahan)
- Optimization (Proses membuat keputusan terbaik berdasarkan kriteria tertentu)