Skip to main content
QUICK REVIEW

[論文レビュー] Differentiable Linear Bandit Algorithm

Kaige Yang, Laura Toni|arXiv (Cornell University)|Jun 4, 2020
Advanced Bandit Algorithms Research参考文献 20被引用数 5
ひとこと要約

この論文では、勾配上昇を用いて信頼区間を学習する微分可能線形バンディットアルゴリズムであるSoftUCBを提案する。これにより、データに適応する探索と活用のトレードオフが可能になる。ハードなargmaxを微分可能なソフトマックスに基づく選択に置き換え、勾配推定器を導入することで、UCBおよびLinTSよりも低いレグレットを達成し、学習された信頼区間($ \hat{\beta}$)は理論的境界よりも著しく小さくなる。

ABSTRACT

Upper Confidence Bound (UCB) is arguably the most commonly used method for linear multi-arm bandit problems. While conceptually and computationally simple, this method highly relies on the confidence bounds, failing to strike the optimal exploration-exploitation if these bounds are not properly set. In the literature, confidence bounds are typically derived from concentration inequalities based on assumptions on the reward distribution, e.g., sub-Gaussianity. The validity of these assumptions however is unknown in practice. In this work, we aim at learning the confidence bound in a data-driven fashion, making it adaptive to the actual problem structure. Specifically, noting that existing UCB-typed algorithms are not differentiable with respect to confidence bound, we first propose a novel differentiable linear bandit algorithm. Then, we introduce a gradient estimator, which allows the confidence bound to be learned via gradient ascent. Theoretically, we show that the proposed algorithm achieves a $ ilde{\mathcal{O}}(\hatβ\sqrt{dT})$ upper bound of $T$-round regret, where $d$ is the dimension of arm features and $\hatβ$ is the learned size of confidence bound. Empirical results show that $\hatβ$ is significantly smaller than its theoretical upper bound and proposed algorithms outperforms baseline ones on both simulated and real-world datasets.

研究の動機と目的

  • 強い分布仮定に依存する固定で保守的な信頼区間を有するUCB型線形バンディットアルゴリズムの限界を解消すること。
  • 期待累積報酬が信頼区間に対して微分可能であるようにすることで、データ駆動型の適応的信頼区間学習を可能にすること。
  • 信頼区間の最適化をオフラインおよびオンライン設定の両方で繰り返し上昇法により行える勾配推定器を開発すること。
  • 問題構造に適応したタイトな信頼区間の学習により、線形バンディット問題におけるレグレットを低減すること。
  • 学習された信頼区間($\\hat{\\beta}$)が理論的最悪ケース境界よりも著しく小さいことが実証され、実用的パフォーマンスの向上が達成されること。

提案手法

  • 推定報酬と不確実性に基づいて、非最適な腕と最適でない腕を区別する新しい微分可能なUCBインデックスを提案する。
  • 非微分可能なargmaxを置き換えるために、ソフトマックスベースの腕選択方針を導入し、信頼区間に対して勾配計算を可能にする。
  • 期待累積報酬の信頼区間サイズ$\beta$に関する勾配推定器を導出する。これにより、勾配上昇による最適化が可能になる。
  • 2つの訓練ルールを設計する:SoftUCBオフライン(履歴データ上でバッチ勾配上昇による$\\hat{\\beta}$の最適化)およびSoftUCBオンライン(各ラウンドで$\\hat{\\beta}$を適応的に更新)。
  • 推定信頼区間$\\hat{\\beta}$が理論的境界$|\\hat{\\mu}_{i,t} - \mu_i| \leq \beta \|\\mathbf{x}_i\|_{\\mathbf{V}_t^{-1}}$を満たすように、ラグランジュ制約を実装する。
  • 非最適な腕の選択確率を低下させるソフトエリミネーション機構を実装し、収束を加速する。

実験結果

リサーチクエスチョン

  • RQ1UCB型線形バンディットアルゴリズムにおける信頼区間を勾配ベース最適化によりエンドツーエンドで学習可能か?
  • RQ2UCBインデックスの微分可能定式化により、レグレットを低減する効果的な適応的信頼区間の学習が可能か?
  • RQ3実際の実験において、学習された信頼区間$\\hat{\\beta}$は理論的最悪ケース境界と比べてどの程度小さいか?
  • RQ4提案手法は、合成的および現実世界の設定において、標準的なベースライン(LinUCB、LinTS、$\\epsilon$-greedy)を上回る性能を示せるか?
  • RQ5学習された$\\hat{\\beta}$は$\eta$(ラグランジュ乗数)などのハイパーパrameterにどれほど敏感か?その結果、ロバストネスにどのような影響があるか?

主な発見

  • すべての実験設定において、学習された信頼区間$\\hat{\\beta}$は理論的上界$\\tilde{\\beta}$よりも著しく小さいことが示され、保守的である度合いが低減している。
  • オフライン設定において、SoftUCBは$\\tilde{\\mathcal{O}}(\\hat{\\beta}\\sqrt{dT})$のレグレット上界を達成する。ここで$\\hat{\\beta}$はデータ適応的信頼区間サイズである。
  • 実験結果から、SoftUCBは合成データおよび実世界データの両方において、LinUCB、LinTS、$\\epsilon$-greedyよりも累積レグレットが低いことが示された。
  • $\\hat{\\beta}$の収束はラグランジュ乗数$\eta$に敏感である。$\eta$が大きすぎたり小さすぎたりすると、収束不能や最適な腕の誤ったエリミネーションが生じる。
  • オンライン設定では、初期段階で非最適な腕がソフトエリミネーションされるまで均一選択が続くため、SoftUCBオンラインは高いレグレットを示すが、その後急速に収束する。
  • ソフトエリミネーション機構により、非最適な腕の選択確率が低下し、収束が加速され、結果としてレグレットが低減している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。