Multi-armed bandit
term_id: multi_armed_bandit
Category: basic_concepts
Definition
Multi-armed bandit-problemet illustrerer dilemmaet en agent står overfor når den avgjør om den skal holde seg til en kjent belønnsverdig alternativ (utnyttelse) eller prøve nye alternativer for å oppdage potensielt bedre belønning
Summary
Et multi-armed bandit-problem er et klassisk problem innen sannsynlighetsteori og forsterkningslæring som modellerer avveiningen mellom utforskning og utnyttelse.
Key Concepts
- Utforskning vs. utnyttelse
- Belønningsmaksimering
- Stokastiske prosesser
- Regret-minimering
Use Cases
- Optimalisering av A/B-testing
- Anbefalingssystemer
- Strategier for annonseplassering