Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Change-Point Detection for Tackling Piecewise-Stationary Bandits

Lilian Besson, Emilie Kaufmann|arXiv (Cornell University)|Feb 5, 2019
Advanced Bandit Algorithms Research参考文献 24被引用数 18
ひとこと要約

本稿では、klUCBとパラメータフリーなベルヌーイ一般化尤度比検定(GLRT)を用いた変化点検出器を組み合わせた、新たなpiecewise-stationary bandits用のアルゴリズムGLR-klUCBを提案する。変化点の数やアーム平均の事前知識が不要であり、明確に分離された大規模な変化を示す「簡単な」インスタンスにおいて、理論的・実験的両面で既存手法を上回る性能を達成し、$Ó(\sqrt{TA\Upsilon_T\ln T})$ のレグレットを達成する。

ABSTRACT

We introduce GLR-klUCB, a novel algorithm for the piecewise iid non-stationary bandit problem with bounded rewards. This algorithm combines an efficient bandit algorithm, kl-UCB, with an efficient, parameter-free, changepoint detector, the Bernoulli Generalized Likelihood Ratio Test, for which we provide new theoretical guarantees of independent interest. Unlike previous non-stationary bandit algorithms using a change-point detector, GLR-klUCB does not need to be calibrated based on prior knowledge on the arms' means. We prove that this algorithm can attain a $O(\sqrt{TA Υ_T\log(T)})$ regret in $T$ rounds on some "easy" instances, where A is the number of arms and $Υ_T$ the number of change-points, without prior knowledge of $Υ_T$. In contrast with recently proposed algorithms that are agnostic to $Υ_T$, we perform a numerical study showing that GLR-klUCB is also very efficient in practice, beyond easy instances.

研究の動機と目的

  • アーム平均が未知の時刻に変化する非定常的マルチアームバンディットの課題に対処すること。
  • 変化点の数($\Upsilon_T$)や最小変化量($\Delta^{\text{change}}$)の事前知識が不要なバンディットアルゴリズムを設計すること。
  • 強力なバンディット戦略(klUCB)とパラメータフリーな変化点検出器(ベルヌーイGLRT)を組み合わせ、理論的・実用的両面での性能向上を図ること。
  • 明確に分離された大規模な変化を示す「簡単な」インスタンスにおいて、近似的に最適なレグレットを達成できることを証明すること。

提案手法

  • アルゴリズムは、確率的バンディットにおいて優れた実験的性能を示すことで知られるklUCBバンディット戦略を用いてアーム選択を行う。
  • 変化量の下限が不要なため、アーム報酬分布のシフトを特定するためにベルヌーイ一般化尤度比検定(GLRT)を変化点検出器として統合する。
  • 2種類のリスタート機構を評価:グローバルリスタート(任意の変化検出時にすべてのアームをリセット)とローカルリスタート(変化が検出されたアームのみをリセット)。
  • 理論的解析により、グローバルリスタートでは$\mathcal{O}(\sqrt{TA\Upsilon_T\ln T}/(\Delta^{\text{change}})^2)$ のレグレットバウンドを確立し、$\Delta^{\text{change}}$ が0から離れている場合には$\mathcal{O}(\sqrt{TA\Upsilon_T\ln T})$ に簡略化される。
  • GLRT検出器は、非漸近的性質を新たに示し、非定常バンディット設定における応用に価値があることが示された。
  • アルゴリズムは、合成的なpiecewise-stationary環境およびYahoo!ニュースのクリックスルーデータを用いた実世界の不安静バンディットタスクの両方で評価された。

実験結果

リサーチクエスチョン

  • RQ1変化点検出に基づくバンディットアルゴリズムは、変化点の数($\Upsilon_T$)の事前知識がなくても最適なレグレットを達成できるか?
  • RQ2ベルヌーイGLRTのようなパラメータフリーな変化点検出器は、アーム平均の推定値に依存しないバンディットフレームワークに効果的に統合可能か?
  • RQ3得られたアルゴリズム、GLR-klUCBは、piecewise-stationary仮定を満たさない環境を含め、多様な非定常バンディット環境においても強力な実験的性能を維持できるか?
  • RQ4GLR-klUCBは、強制的探索なしに、不安静で劣化するバンディット(rotting bandits)のような非定常設定でも対数的レグレットを達成できるか?

主な発見

  • グローバルリスタート下でGLR-klUCBは$\mathcal{O}(\sqrt{TA\Upsilon_T\ln T}/(\Delta^{\text{change}})^2)$ のレグレットバウンドを達成し、$\Delta^{\text{change}}$ が0から離れている場合にはSeznecら(2020)の下界と$\sqrt{\ln T}$ 要素を除いて一致する。
  • $T=20000$, $K=5$, $\Upsilon=6$, $\Delta_{\min}=0.05$, $d_{\min}=1000$ の数値実験では、GLR-klUCBのグローバルリスタートは平均3.1回のリスタートでレグレット611を達成し、他のCPDベースのアルゴリズムを上回った。
  • 実世界のYahoo!ニュースクリックスルーデータセットでは、ローカルリスタートと強制的探索なしのGLR-klUCBはExp3.SとFEWAを著しく上回り、状態最良のrotting banditsアルゴリズムであるRAW-UCBと同等の性能を達成した。
  • レグレット曲線が大規模かつ孤立した変化の下で対数的形状を示しており、非増加的piecewiseバンディット問題において対数的レグレットが達成可能である可能性を示唆している。
  • 理論的バウンドが$\Delta^{\text{change}}$ に依存するものの、実験ではすべての変化が検出されない「より難しい」インスタンスに対してもGLR-klUCBが良好な性能を示し、理論的仮定を上回るロバストネスを示した。
  • ベルヌーイGLRT検出器は、変化量の下限が不要であることが示され、アーム平均値に依存しないため、CUSUM や M-UCB よりも実用的であることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。