Multi-armed bandit
term_id: multi_armed_bandit
Category: basic_concepts
Definition
Problemet med multi-armed bandit illustrerar dilemmat som en agent står inför när den avgör om den ska stanna kvar vid en känd belönande alternativ (utnyttjande) eller prova nya alternativ för att upptäcka potentiellt bättre belöningar
Summary
En multi-armed bandit är ett klassiskt problem inom sannolikhetsteori och förstärkningsinlärning som modellerar avvägningen mellan utforskning och utnyttjande.
Key Concepts
- Utforskning kontra utnyttjande
- Belöningsmaximering
- Stokastiska processer
- Regret-minimering
Use Cases
- Optimering av A/B-testning
- Rekommendationssystem
- Strategier för annonsplacering