Multi-armed Bandit

term_id: multi_armed_bandit

Category: basic_concepts

Definition

Das Multi-armed-Bandit-Problem veranschaulicht das Dilemma, vor dem eine Agent steht, wenn sie entscheidet, ob sie bei einer bekannten, belohnenden Option bleiben soll (Exploitation) oder neue Optionen ausprobieren sollte, um potenziell bessere Belohnungen zu finden…

Summary

Ein Multi-armed Bandit ist ein klassisches Problem der Wahrscheinlichkeitstheorie und des Reinforcement Learning, das den Zielkonflikt zwischen Exploration und Exploitation modelliert.

Key Concepts

  • Exploration vs. Exploitation
  • Belohnungsmaximierung
  • Stochastische Prozesse
  • Regret-Minimierung (Bedauernsminimierung)

Use Cases

  • Optimierung von A/B-Tests
  • Empfehlungssysteme
  • Strategien zur Werbeeinblendung