Multi-armed bandit

term_id: multi_armed_bandit

Category: basic_concepts

Definition

Het multi-armed bandit-probleem illustreert het dilemma waarvoor een agent staat wanneer deze moet beslissen of hij bij een bekende belonende optie blijft (exploitatie) of nieuwe opties probeert om potentieel betere beloningen te ontdekken…

Summary

Een multi-armed bandit is een klassiek probleem in de waarschijnlijkheidsleer en reinforcement learning dat de afweging tussen exploratie en exploitatie modelleert.

Key Concepts

  • Exploratie versus exploitatie
  • Beloning maximalisatie
  • Stochastische processen
  • Regret-minimalisatie

Use Cases

  • Optimalisatie van A/B-testen
  • Aanbevelingssystemen
  • Strategieën voor advertentieplaatsing