Multi-armed Bandit
term_id: multi_armed_bandit
Category: basic_concepts
Definition
Das Multi-armed-Bandit-Problem veranschaulicht das Dilemma, vor dem eine Agent steht, wenn sie entscheidet, ob sie bei einer bekannten, belohnenden Option bleiben soll (Exploitation) oder neue Optionen ausprobieren sollte, um potenziell bessere Belohnungen zu finden…
Summary
Ein Multi-armed Bandit ist ein klassisches Problem der Wahrscheinlichkeitstheorie und des Reinforcement Learning, das den Zielkonflikt zwischen Exploration und Exploitation modelliert.
Key Concepts
- Exploration vs. Exploitation
- Belohnungsmaximierung
- Stochastische Prozesse
- Regret-Minimierung (Bedauernsminimierung)
Use Cases
- Optimierung von A/B-Tests
- Empfehlungssysteme
- Strategien zur Werbeeinblendung