Skip to main content
QUICK REVIEW

[論文レビュー] New Insights into Bootstrapping for Bandits

Sharan Vaswani, Branislav Kveton|arXiv (Cornell University)|May 24, 2018
Advanced Bandit Algorithms Research参考文献 28被引用数 12
ひとこと要約

この論文は、ベルヌーイバンディット設定において、非パラメトリックブートストラップ(NPB)に根本的な理論的欠陥があることを特定し、近似的に線形のレグレットを引き起こす可能性があることを証明している。解決策として、重み付きブートストラップ(WB)を提案する。ベルヌーイおよびガウス分布の報酬に対して、WBは理論的にトンプソンサンプリングと同等であり、近似的に最適なレグレットを達成する。また、有界な分布においてNPBおよび標準的なTSよりも実験的に優れている。

ABSTRACT

We investigate the use of bootstrapping in the bandit setting. We first show that the commonly used non-parametric bootstrapping (NPB) procedure can be provably inefficient and establish a near-linear lower bound on the regret incurred by it under the bandit model with Bernoulli rewards. We show that NPB with an appropriate amount of forced exploration can result in sub-linear albeit sub-optimal regret. As an alternative to NPB, we propose a weighted bootstrapping (WB) procedure. For Bernoulli rewards, WB with multiplicative exponential weights is mathematically equivalent to Thompson sampling (TS) and results in near-optimal regret bounds. Similarly, in the bandit setting with Gaussian rewards, we show that WB with additive Gaussian weights achieves near-optimal regret. Beyond these special cases, we show that WB leads to better empirical performance than TS for several reward distributions bounded on $[0,1]$. For the contextual bandit setting, we give practical guidelines that make bootstrapping simple and efficient to implement and result in good empirical performance on real-world datasets.

研究の動機と目的

  • マルチアームバンディット設定における非パラメトリックブートストラップ(NPB)の理論的限界を特定すること。
  • ベルヌーイ分布およびガウス分布の報酬に対して、近似的に最適なレグレットを達成し、トンプソンサンプリング(TS)と一致する重み付きブートストラップ(WB)手順を提案すること。
  • 文脈バンディットにおけるブートストラップの実装に向けた、ハイパーパrameterフリーの実用的ガイドラインを提供すること。
  • さまざまな報酬分布および実世界のデータセットを用いて、WBをNPBおよびTSと比較して実験的に評価すること。

提案手法

  • 論文は、ベルヌーイ報酬に対して乗法的指数重みを用いてブートストラップ標本を抽出する重み付きブートストラップ(WB)を導入する。
  • ガウス分布の報酬に対しては、加法的ガウス重みを用い、近似的に最適なレグレットバウンドを達成する。
  • WBは、ベルヌーイおよびガウス分布の報酬仮定の下で、数学的にトンプソンサンプリング(TS)と同等であることが示されている。
  • 文脈バンディット設定では、特徴量の分散を維持するために、文脈共分散行列の固有ベクトルを用いたハイパーパrameterフリーの初期化を提案する。
  • ブートストラップモデルの最尤推定値を効率的に計算するために、ラウンド間でウォームスタートを用いた確率的勾配降下法を用いる。
  • 実験的評価では、ハイパーパrameterチューニングを避けるために、ブートストラップ標本を用いたロジスティック回帰、ニューラルネットワーク、線形モデルを用いる。

実験結果

リサーチクエスチョン

  • RQ1ベルヌーイ報酬を伴うマルチアームバンディット設定において、非パラメトリックブートストラップ(NPB)は、証明可能な非効率性を示すか?
  • RQ2重み付きブートストラップ(WB)は、ベルヌーイおよびガウス分布の報酬を伴うバンディット問題において、近似的に最適なレグレットを達成するか?
  • RQ3有界な報酬分布において、WBは実験的にトンプソンサンプリング(TS)および非パラメトリックブートストラップ(NPB)と比較してどのように性能を発揮するか?
  • RQ4ハイパーパrameterチューニングなしで、文脈バンディットにおけるブートストラップを実用的かつ効率的に可能にすることができるか?
  • RQ5強制的探索なしで、文脈バンディットにおけるブートストラップの良好な性能を保証する初期化戦略は何か?

主な発見

  • ベルヌーイバンディット設定において、NPBは近似的に線形のレグレット下界を被るため、証明的に非効率であることが示された。
  • 強制的探索を伴うNPBは、サブ線形ではあるが、サブ最適なレグレットを示しており、この手法に内在する限界が裏付けられた。
  • 乗法的指数重みを用いたWBは、ベルヌーイ報酬の下で、数学的にトンプソンサンプリング(TS)と同等であり、近似的に最適なレグレットを達成する。
  • ガウス分布の報酬に対しては、加法的ガウス重みを用いたWBも、近似的に最適なレグレットバウンドを達成する。
  • 実世界のデータセット(CovTypeおよびMNIST)において、ロジスティック回帰およびニューラルネットワークを用いたWBは、NPBを上回り、チューニング済みのεグリーディの性能と同等またはそれを上回った。
  • CovTypeでは、WBにロジスティック回帰を用いた場合、1ラウンドあたり平均0.16秒で実行され、MNISTでは1ラウンドあたり平均1.88秒で実行され、計算効率が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。