Multi-armed bandit
term_id: multi_armed_bandit
Category: basic_concepts
Definition
Het multi-armed bandit-probleem illustreert het dilemma waarvoor een agent staat wanneer deze moet beslissen of hij bij een bekende belonende optie blijft (exploitatie) of nieuwe opties probeert om potentieel betere beloningen te ontdekken…
Summary
Een multi-armed bandit is een klassiek probleem in de waarschijnlijkheidsleer en reinforcement learning dat de afweging tussen exploratie en exploitatie modelleert.
Key Concepts
- Exploratie versus exploitatie
- Beloning maximalisatie
- Stochastische processen
- Regret-minimalisatie
Use Cases
- Optimalisatie van A/B-testen
- Aanbevelingssystemen
- Strategieën voor advertentieplaatsing