マルチアームドバンディット

term_id: multi_armed_bandit

Category: basic_concepts

Definition

マルチアームドバンディット問題は、既知の報酬のあるオプションに固執するか(活用)、潜在的により良い報酬を発見するために新しいオプションを試すか(探索)というエージェントのジレンマを示しています。

Summary

マルチアームドバンディットは、探索と活用のトレードオフをモデル化する確率論および強化学習における古典的な問題です。

Key Concepts

  • 探索対活用
  • 報酬最大化
  • 確率過程
  • レグレット最小化

Use Cases

  • A/Bテストの最適化
  • 推薦システム
  • 広告掲載戦略