Skip to main content
QUICK REVIEW

[論文レビュー] A Change-Detection based Framework for Piecewise-stationary Multi-Armed Bandit Problem

Fang Liu, Joohyun Lee|arXiv (Cornell University)|Nov 8, 2017
Advanced Bandit Algorithms Research参考文献 20被引用数 15
ひとこと要約

本稿では、報酬分布の変化を検出する仕組みを備えた、区分的定常なマルチアームバンディットに対するCD-UCBと呼ばれるフレームワークを提案する。このフレームワークは、UCB探索の再起動を実行する。CUSUMとPage-Hinkleyテストを用いたCUSUM-UCBおよびPHT-UCBを実装し、やや緩い仮定のもとで、$O(\sqrt{T\gamma_T\log(T/\gamma_T)})$という、これまでに得られた最良のレグレットバウンドを達成した。合成データおよび実世界のデータ(Yahoo!クリックスルーレート)の両方で、既存の手法を上回る性能を示した。

ABSTRACT

The multi-armed bandit problem has been extensively studied under the stationary assumption. However in reality, this assumption often does not hold because the distributions of rewards themselves may change over time. In this paper, we propose a change-detection (CD) based framework for multi-armed bandit problems under the piecewise-stationary setting, and study a class of change-detection based UCB (Upper Confidence Bound) policies, CD-UCB, that actively detects change points and restarts the UCB indices. We then develop CUSUM-UCB and PHT-UCB, that belong to the CD-UCB class and use cumulative sum (CUSUM) and Page-Hinkley Test (PHT) to detect changes. We show that CUSUM-UCB obtains the best known regret upper bound under mild assumptions. We also demonstrate the regret reduction of the CD-UCB policies over arbitrary Bernoulli rewards and Yahoo! datasets of webpage click-through rates.

研究の動機と目的

  • 報酬分布が時間とともに変化する非定常環境下で、古典的なマルチアームバンディットアルゴリズムの限界を解決すること。
  • 変化点を検出し、バンディット方策を再起動することで、性能を維持する能動的適応フレームワークの開発。
  • 区分的定常条件の下で、変化検出に基づくUCB方策の理論的レグレット上界を提供すること。
  • 合成データおよび実世界データの両方で、受動的適応および既存の能動的適応方策と比較して、提案手法の経験的優位性を示すこと。

提案手法

  • 変化検出アルゴリズムとUCBを統合し、分布のシフトを検出し、UCBインデックスを再起動する一般化されたCD-UCBフレームワークを提案する。
  • 累積和(CUSUM)統計量を用いて報酬平均の変化を検出するCUSUM-UCBを実装する。
  • 基準平均からの偏差の累積和に基づいて変化を検出するPage-Hinkleyテスト(PHT)を用いたPHT-UCBを実装する。
  • 下位の変化検出アルゴリズムの検出遅延および誤報率に依存する、CD-UCB方策の一般化されたレグレット上界を導出する。
  • 合成ベルヌーイ報酬環境および実世界のYahoo!ウェブページのクリックスルーレートデータにこのフレームワークを適用する。
  • 経験的性能比較のため、非線形最小二乗法フィッティングを用いて、$at^b + c$における非線形レグレット指数$b$を推定する。

実験結果

リサーチクエスチョン

  • RQ1変化検出に基づくフレームワークは、受動的適応方策と比較して、区分的定常なマルチアームバンディット問題におけるレグレット性能を向上させることができるか?
  • RQ2分布の変化を検出し反応する能動的適応UCB方策の理論的レグレット上界は何か?
  • RQ3異なる変化率および環境下で、CUSUM-UCBとPHT-UCBは、レグレットと検出信頼性の観点からどのように比較されるか?
  • RQ4提案されたフレームワークは、D-UCB、SW-UCB、Exp3.R、Rexp3といった既存の手法よりも、実世界データでより優れた経験的性能を達成するか?
  • RQ5なぜPHT-UCBは低変化環境ではCUSUM-UCBを上回るが、高変化設定では成績を落とすのか?

主な発見

  • CUSUM-UCBは、区分的定常仮定のもとで、$O(\sqrt{T\gamma_T\log(T/\gamma_T)})$という、これまでに得られた最良のレグレット上界を達成した。これは、既存の手法よりもタイトである。
  • 変化点が$\gamma_T$個ある合成ベルヌーイ環境では、CUSUM-UCBとPHT-UCBは、それぞれ指数$b=0.72$および$b=0.69$の非線形レグレットを示した。これは、D-UCB($b=0.89$)およびSW-UCB($b=0.84$)と比較して顕著に低い。
  • K=5のYahoo!データセットでは、受動的適応方策(D-UCB、SW-UCB、Rexp3)は線形レグレット($b \approx 1$)を示したが、CUSUM-UCBとPHT-UCBは、それぞれ$b=0.69$および$b=0.79$の非線形レグレットを達成した。
  • K=100のYahoo!実験では、CUSUM-UCBは$b=0.85$という高い性能を維持したが、PHT-UCBはわずかに低下し、$b=0.90$となった。これは、高変化率に対して感受性が高いことを示している。
  • PHT-UCBは、$\hat{y}_k$の更新によるより安定した推定のおかげで、低変化環境ではCUSUM-UCBを上回るが、変化が頻繁に発生する環境では、検出までの間に推定値がずれ込むため、成績が劣化する。
  • 経験的結果は、変化検出による能動的適応が、受動的適応よりも優れた性能をもたらすことを確認しており、特に変化がまれで予測可能である場合には顕著である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。