Multi-armed bandit

term_id: multi_armed_bandit

Category: basic_concepts

Definition

Multi-armed bandit-problemet illustrerer dilemmaet en agent står overfor når den avgjør om den skal holde seg til en kjent belønnsverdig alternativ (utnyttelse) eller prøve nye alternativer for å oppdage potensielt bedre belønning

Summary

Et multi-armed bandit-problem er et klassisk problem innen sannsynlighetsteori og forsterkningslæring som modellerer avveiningen mellom utforskning og utnyttelse.

Key Concepts

  • Utforskning vs. utnyttelse
  • Belønningsmaksimering
  • Stokastiske prosesser
  • Regret-minimering

Use Cases

  • Optimalisering av A/B-testing
  • Anbefalingssystemer
  • Strategier for annonseplassering