Skip to main content
QUICK REVIEW

[論文レビュー] Contextual Bandits with Continuous Actions: Smoothing, Zooming, and Adapting

Akshay Krishnamurthy, John Langford|arXiv (Cornell University)|Feb 5, 2019
Advanced Bandit Algorithms Research参考文献 55被引用数 17
ひとこと要約

本稿では、連続的行動空間における文脈的バンディット問題に対して、平滑化に基づく新規なアプローチを提案する。ポリシーはバンド幅パラメータ $ h $ を用いて文脈を行動の分布へ写像する。滑らか化されたベンチマークに対するレグレットを測定することで、未知の滑らかさに適応するインスタンス依存およびワーストケースのレグレットバウンドを達成し、チューニングを必要とせず、最適な適応性を実現する。リプシッチッツ仮定やパラメータの事前知識がなくても、良性な問題に対して顕著に性能が向上する。

ABSTRACT

We study contextual bandit learning with an abstract policy class and continuous action space. We obtain two qualitatively different regret bounds: one competes with a smoothed version of the policy class under no continuity assumptions, while the other requires standard Lipschitz assumptions. Both bounds exhibit data-dependent "zooming" behavior and, with no tuning, yield improved guarantees for benign problems. We also study adapting to unknown smoothness parameters, establishing a price-of-adaptivity and deriving optimal adaptive algorithms that require no additional information.

研究の動機と目的

  • 連続的行動空間における既存の文脈的バンディットアルゴリズムの限界、特にグローバルなリプシッチッツ仮定や未知のパラメータに依存する点を是正すること。
  • 行動の滑らかでない、または不連続な損失関数に対しても有効なレグレットフレームワークを構築するため、行動の滑らか化されたベンチマークを導入すること。
  • バンド幅やリプシッチッツ定数の事前知識がなくても、未知の滑らかさパラメータに自動的に適応するアルゴリズムを設計すること。
  • ポリシークラスの複雑さや問題の本質的構造に応じてスケーリングされる、最適なインスタンス依存およびワーストケースのレグレット保証を達成すること。
  • ズーミングおよび非パラメトリックバンディット手法を統合的に統一し、1つのアルゴリズムフレームワーク内で平滑化と適応性を組み合わせることによる改善を図ること。

提案手法

  • 各行動 $ a $ を $[a-h, a+h]$ 上の一様分布に置き換えることで、滑らか化されたポリシークラスを定義し、ベンチマークを行動の連続的で滑らかな関数へと変換する。
  • 学習者のパフォーマンスを滑らか化されたポリシークラスに属する最良のポリシーと比較する「滑らか化されたレグレット」という新しいレグレットの概念を定義する。これにより、不連続な損失による近似誤差を回避できる。
  • すべてのバンド幅 $ h $ に対して動作する統一されたアルゴリズムフレームワーク $\mathtt{ContinuousEXP4}$ を用いることで、チューニングなしに適応的性能を達成する。
  • 観測された損失に基づいて行動領域を動的に精錬するデータ依存的「ズーミング」行動を活用し、良性なインスタンスでのレグレットを改善する。
  • $\mathtt{Corral+EXP4}$ を統合することで、未知の滑らかさレベルに対しても適応的性能を達成し、下界に一致する理論的保証を得る。
  • 安定性および集中の議論を用いて、滑らかさのバンド幅 $ h $ が未知または変動しても、アルゴリズムが低レグレットを維持することを証明する。

実験結果

リサーチクエスチョン

  • RQ1グローバルなリプシッチッツ連続性のような強い仮定に依存しない、連続的行動空間向けの文脈的バンディットアルゴリズムを設計できるか?
  • RQ2滑らかさパラメータの事前知識がなくても、ポリシークラスの固有の複雑さや損失構造に適応するインスタンス依存のレグレットバウンドを達成できるか?
  • RQ3手動のチューニングが不要な1つのアルゴリズムを設計し、すべてのバンド幅 $ h $ で最適な性能を発揮できるか?
  • RQ4滑らかさパラメータが未知である場合の適応性のコストは何か?そして、実用的なアルゴリズムがそのコストを下界に一致させられるか?
  • RQ5提案された平滑化フレームワークは、既存のズーミングおよび非パラメトリックバンディット手法と比較して、レグレット保証およびスケーラビリティの面でどのように優れているか?

主な発見

  • 滑らか化されたレグレットのワーストケースレグレットは $ \Theta\left(\sqrt{T/h}\right) $ であり、任意の固定された $ h $ に対して最適レートに一致する。連続性仮定がなくても成立する。
  • インスタンス依存のレグレットでは、$ O\left(\min_{\epsilon} T\epsilon + \theta_h(\epsilon)\right) $ のバウンドが得られ、$ \theta_h(\epsilon) \leq 1/(h\epsilon) $ を満たす。これにより、良性な問題で性能が向上する。
  • すべての $ h \in (0,1] $ に対して最適な適応性を達成し、レグレットは $ \Theta\left(\sqrt{T}/h\right) $ となり、定数の違いを除いて下界に一致する。
  • リプシッチッツ損失関数に対しては、$ \Theta\left(T^{2/3}\sqrt{L}\right) $ のレグレットを達成し、下界に一致し、先行研究を改善する。
  • 高次元設定では、ポリシー・ズーミング係数 $ \psi_L(\epsilon) $ が $ O\left(\frac{L}{L_0} \cdot \frac{\sqrt{d}}{\epsilon}\right) $ であることが示され、スケーラブルなパフォーマンスが可能になる。
  • 下界を確立し、任意の適応的アルゴリズムが $ \Omega(T^{2/3}\sqrt{L}) $ よりも良いレグレットを達成できないことを示し、提案された適応的アルゴリズムの最適性を証明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。