Skip to main content
QUICK REVIEW

[論文レビュー] Nonstationary Stochastic Multiarmed Bandits: UCB Policies and Minimax Regret

Lai Wei, Vaibhav Srivastava|arXiv (Cornell University)|Jan 22, 2021
Advanced Bandit Algorithms Research参考文献 38被引用数 5
ひとこと要約

本稿では、平均報酬の変動予算が有界な非定常確率的マルチアームバンディットに対して、UCBに基づく方策——定期的リセット、スライディングウィンドウ、割引——を提案する。最小最大のレグレットバウンドを順序的に最適に確立し、推定のロバスト性を用いて重尾分布へと拡張し、非定常性下でもほぼ最適な性能を維持する。

ABSTRACT

We study the nonstationary stochastic Multi-Armed Bandit (MAB) problem in which the distribution of rewards associated with each arm are assumed to be time-varying and the total variation in the expected rewards is subject to a variation budget. The regret of a policy is defined by the difference in the expected cumulative rewards obtained using the policy and using an oracle that selects the arm with the maximum mean reward at each time. We characterize the performance of the proposed policies in terms of the worst-case regret, which is the supremum of the regret over the set of reward distribution sequences satisfying the variation budget. We extend Upper-Confidence Bound (UCB)-based policies with three different approaches, namely, periodic resetting, sliding observation window and discount factor and show that they are order-optimal with respect to the minimax regret, i.e., the minimum worst-case regret achieved by any policy. We also relax the sub-Gaussian assumption on reward distributions and develop robust versions the proposed polices that can handle heavy-tailed reward distributions and maintain their performance guarantees.

研究の動機と目的

  • 報酬の期待値が時間とともに変化する非定常環境における確率的マルチアームバンディットの課題に対処する。
  • 期待報酬の変化総量を制限する変動予算を用いて問題を定式化する。
  • 非定常設定において、古き情報を記憶し、陳腐化した情報を忘れるバランスを取るUCBベースの方策を設計する。
  • 報酬分布に対するサブガウス型仮定を緩和し、重尾分布を含める。
  • 最小最大のレグレットバウンドを確立し、提案された方策が理論的下界に対して順序的に最適であることを示す。

提案手法

  • 非定常性に対処するための3つのUCB方策バリエーション——定期的リセット、スライディングウィンドウ、割引係数ベースのUCB——を導入する。
  • 時間的に変化する期待値下での推定誤差を制御するため、打ち切り済みの実現平均と信頼区間を用いる。
  • 打ち切り済みおよびウィnザーダ統計を用いたロバスト推定フレームワークを適用し、重尾報酬分布に対処する。
  • 変動予算 $V_T$ を定義し、時間経過に伴う期待報酬の合計変動を制約することで非定常性を制御する。
  • 集中不等式を用いてレグレットバウンドを導出し、最悪ケースのレグレットが最小最大下界の定数倍の範囲内にあることを示す。
  • ウィンドウサイズや割引係数などのパラメータを調整し、変化する環境下での探索と活用のバランスを取る。

実験結果

リサーチクエスチョン

  • RQ1UCBベースの方策は、変動予算が有界な非定常確率的MABにおいて、最小最大のレグレットを順序的に最適に達成できるか?
  • RQ2定期的リセット、スライディングウィンドウ、割引といった異なる忘却メカニズムは、非定常設定下でのレグレット性能にどのように影響するか?
  • RQ3ロバストUCB方策は、サブガウス型仮定なしに重尾報酬分布下でも順序的に最適なレグレットを維持できるか?
  • RQ4非定常確率的環境下で、Exp3 や DTS といった既存のバンディットアルゴリズムの性能に非定常性が与える影響は何か?
  • RQ5時間的に変化する報酬分布下でも性能を維持できるメモリ効率の良いUCB方策を設計することは可能か?

主な発見

  • 提案されたUCB方策——R-MOSS、SW-MOSS、D-UCB——は、最小最大下界 $\Omega((KV_T)^{1/3}T^{2/3})$ の定数倍の最悪ケースレグレットを達成する。
  • ロバスト版であるR-RMOSSとSW-RMOSSは、一般化されたパレートノイズを伴う重尾報酬分布下でも順序的に最適なレグレットを維持する。
  • 数値実験の結果、R-MOSSとSW-MOSSは非定常確率的環境下で敵対的バンディット方策(例:Rexp3、Exp3.S)を上回る性能を示す。
  • DTSは最良の腕が切り替わらない場合に良好に機能するが、最適腕が変化する場合には遅れによる適応の遅れにより高いレグレットを示す。
  • 重尾設定下でのレグレットのヒストグラムから、R-RMOSSとSW-RMOSSがより一貫性があり、平均レグレットからの分散が小さいことが示された。
  • 割引係数法はメモリ効率が良いが、重尾設定下でのロバスト推定との統合は未解決の問題のままである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。