Multi-armed bandit

term_id: multi_armed_bandit

Category: basic_concepts

Definition

Problemet med multi-armed bandit illustrerar dilemmat som en agent står inför när den avgör om den ska stanna kvar vid en känd belönande alternativ (utnyttjande) eller prova nya alternativ för att upptäcka potentiellt bättre belöningar

Summary

En multi-armed bandit är ett klassiskt problem inom sannolikhetsteori och förstärkningsinlärning som modellerar avvägningen mellan utforskning och utnyttjande.

Key Concepts

  • Utforskning kontra utnyttjande
  • Belöningsmaximering
  • Stokastiska processer
  • Regret-minimering

Use Cases

  • Optimering av A/B-testning
  • Rekommendationssystem
  • Strategier för annonsplacering