Skip to main content
QUICK REVIEW

[論文レビュー] Smooth Contextual Bandits: Bridging the Parametric and Non-differentiable Regret Regimes

Yichun Hu, Nathan Kallus|arXiv (Cornell University)|Sep 5, 2019
Advanced Bandit Algorithms Research参考文献 32被引用数 6
ひとこと要約

本稿は、期待報酬関数を Hölder 現象(smoothness パラメータ $eta$)に従ってモデル化することで、パrametric および非微分可能レジームを統一する、新しい滑らかなコンテキストバンドイットアルゴリズムを提案する。$eta \in (0, \infty]$ のすべての範囲でレジーム最適なレジームを達成し、$eta = \infty$(パラメトリック)の場合には対数的レジームを回復し、$eta < \infty$ の場合には $\tilde{O}(T^{\frac{\beta+d}{2\beta+d}})$ を達成する。これにより、グローバルな外挿とローカルな学習戦略の間のギャップが埋められる。

ABSTRACT

We study a nonparametric contextual bandit problem where the expected reward functions belong to a Hölder class with smoothness parameter $β$. We show how this interpolates between two extremes that were previously studied in isolation: non-differentiable bandits ($β\leq1$), where rate-optimal regret is achieved by running separate non-contextual bandits in different context regions, and parametric-response bandits (satisfying $β=\infty$), where rate-optimal regret can be achieved with minimal or no exploration due to infinite extrapolatability. We develop a novel algorithm that carefully adjusts to all smoothness settings and we prove its regret is rate-optimal by establishing matching upper and lower bounds, recovering the existing results at the two extremes. In this sense, our work bridges the gap between the existing literature on parametric and non-differentiable contextual bandit problems and between bandit algorithms that exclusively use global or local information, shedding light on the crucial interplay of complexity and regret in contextual bandits.

研究の動機と目的

  • 報酬関数の滑らかさのスケールにわたるコンテキストバンドイットの統一的分析を実現すること。非微分可能($\beta \leq 1$)からパラメトリック($\beta = \infty$)の設定までをカバーする。
  • 従来のパラメトリックおよび非微分可能なコンテキストバンドイットに関する文献の理論的ギャップを埋めること。これらは独立に研究されてきた。
  • 報酬関数の未知の滑らかさ $\beta$ に応じて、グローバル情報とローカル情報のバランスを適応的にとるアルゴリズムを開発すること。
  • すべての $\beta \in (0, \infty]$ に対して、レジームのレート最適性を示す上界と下界を確立すること。

提案手法

  • アルゴリズムは、局所的な密度と滑らかさに基づいて文脈空間を適応的ハイパーキューブに分割し、可能な限りグローバル構造を保ちながら局所的学習を可能にする。
  • 推定された滑らかさ $\beta$ に応じて探索半径を調整する階層的探索戦略を用いることで、局所的精度とグローバルな外挿のバランスを取る。
  • 近似的に最適な腕の混同確率を制御するためのマージン条件(仮定5, iv)を組み込むことで、レジームバウンドが $\epsilon^{1+\alpha}$ のスケーリングに従うようにする。
  • 信頼区間に基づく腕選択ルールを適用し、アクティブな腕集合を動的に維持し、最適な腕が誤って除外されないよう保証する。
  • レジーム解析は、良好に推定された領域における非最適腕の選択によるレジームと、推定が不十分な領域における推定誤差によるレジームに、新たな分解を用いる。
  • 推定誤差とイベント失敗($\mathcal{G}_{k-1}$ および $\mathcal{M}_{k-1}$ を通じて)の高確率バウンドを証明し、既知の下界と一致するタイトなレジームバウンドを導出する。

実験結果

リサーチクエスチョン

  • RQ1コンテキストバンドイットにおいて、すべての Hölder スムーズネスレベル $\beta \in (0, \infty]$ で、レート最適なレジームを達成できる単一のアルゴリズムはどのように設計できるか?
  • RQ2非パラメトリックコンテキストバンドイットにおいて、グローバルな外挿とローカルな学習の間の根本的トレードオフは何か?
  • RQ3統一されたアルゴリズムは、パラメトリックバンドイット(対数的レジーム)と非微分可能なバンドイット(レジーム $\sim T^{\frac{\beta+d}{2\beta+d}}$)の間の性能ギャップを埋められるか?
  • RQ4滑らかさ $\beta$、次元 $d$、およびマージン条件 $\alpha$ の相互作用が、非パラメトリックバンドイットにおけるミニマックスレジームにどのように影響するか?
  • RQ5報酬関数が滑らかであるが、必ずしも微分可能ではない場合に、探索と活用の最適なバランスは何か?

主な発見

  • 提案されたアルゴリズムは、すべての $\beta \in (0, \infty]$ でレート最適なレジームを達成し、有限の $\beta$ に対しては $\tilde{O}(T^{\frac{\beta+d}{2\beta+d}})$ のスケーリングを示す。これは既知の下界と一致する。
  • $\beta = \infty$(パラメトリックケース)の場合、アルゴリズムは対数的レジームを回復し、無限の滑らかさ下ではグリーディ戦略が最適であることを確認する。
  • $\beta \leq 1$(非微分可能ケース)の場合、レジームは $\tilde{O}(T^{\frac{\beta+d}{2\beta+d}})$ バウンドと一致し、先行する非パラメトリック研究の結果を回復する。
  • アルゴリズムは、$\beta$ が小さい場合には局所的近傍を、$\beta$ が大きい場合にはグローバルな外挿を適切に使用することで、ローカルとグローバルな学習のバランスを適応的にとる。
  • マージン条件(仮定5, iv)により、近似的に最適な腕の混同確率が制御され、$\epsilon_k$ に依存する依存性が改善され、よりタイトなレジームバウンドが得られる。
  • 解析により、推定誤差とイベント失敗に起因するレジームは $\tilde{O}(1)$ であることが示され、支配的項は $\tilde{O}(T^{\frac{\beta+d}{2\beta+d}})$ 項となる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。