Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Armed Bandits with Metric Movement Costs

Tomer Koren, Roi Livni|arXiv (Cornell University)|Oct 24, 2017
Advanced Bandit Algorithms Research被引用数 7
ひとこと要約

本稿は、既知のメトリックに基づく移動コストを伴うマルチアームバンディットのための新しいフレームワークを導入する。行動間の切り替えにはコストが発生するが、そのコストは既知のメトリックに従う。有限メトリック空間では、複雑性測度 $ olimits\mathcal{C}$(被覆数に基づく)を用いて、$ olimits\widetilde{O}(\max\{\mathcal{C}^{1/3}T^{2/3}, \sqrt{kT}\})$ のタイトなレグレットバウンドを達成する効率的なアルゴリズムを提案する。無限空間では、Lipschitz損失を仮定し、$d$ をミンコフスキー次元として $ olimits\widetilde{O}(T^{(d+1)/(d+2)})$ のレグレットバウンドを達成する。

ABSTRACT

We consider the non-stochastic Multi-Armed Bandit problem in a setting where there is a fixed and known metric on the action space that determines a cost for switching between any pair of actions. The loss of the online learner has two components: the first is the usual loss of the selected actions, and the second is an additional loss due to switching between actions. Our main contribution gives a tight characterization of the expected minimax regret in this setting, in terms of a complexity measure $\mathcal{C}$ of the underlying metric which depends on its covering numbers. In finite metric spaces with $k$ actions, we give an efficient algorithm that achieves regret of the form $\widetilde{O}(\max\{\mathcal{C}^{1/3}T^{2/3},\sqrt{kT}\})$, and show that this is the best possible. Our regret bound generalizes previous known regret bounds for some special cases: (i) the unit-switching cost regret $\widetildeΘ(\max\{k^{1/3}T^{2/3},\sqrt{kT}\})$ where $\mathcal{C}=Θ(k)$, and (ii) the interval metric with regret $\widetildeΘ(\max\{T^{2/3},\sqrt{kT}\})$ where $\mathcal{C}=Θ(1)$. For infinite metrics spaces with Lipschitz loss functions, we derive a tight regret bound of $\widetildeΘ(T^{\frac{d+1}{d+2}})$ where $d \ge 1$ is the Minkowski dimension of the space, which is known to be tight even when there are no switching costs.

研究の動機と目的

  • 行動空間における移動コスト(既知のメトリックで定義される)を伴うオンライン学習をモデル化・分析すること。
  • ユニットスイッチングコストや区間メトリックに限らない、任意の有限および無限メトリック空間への先行研究の一般化。
  • 移動コストが存在する状況におけるミニマックスレグレットを特徴付ける複雑性測度 $\mathcal{C}$ の同定。
  • 有限および連続的メトリック空間の両方で最適なレグレットを達成できる効率的アルゴリズムの開発。

提案手法

  • 著者らは、メトリックの被覆数に基づく被覆/パッキング複雑性測度 $\mathcal{C}$ を定義し、行動空間内での移動の本質的難易度を捉える。
  • 元のメトリック $\Delta$ を 4-ドミネートするツリー・メトリック $\Delta_{\mathcal{T}}$ を構築し、$\mathcal{C}(\mathcal{T}) = O(\mathcal{C}_{\textrm{c}}(\Delta)\log k)$ となるようにする。これにより、ツリー構造のバンディット問題に還元可能となる。
  • スイッチングコストを避けるために、サンプリング分布を制御することで、SMB(Slowly Moving Bandit)アルゴリズムをツリー・メトリックに拡張する。
  • 無限空間では、$\epsilon$-ネットを用いてメトリック空間を離散化し、有限ケースの結果を適用する。$\epsilon$ を最適化することで近似誤差とレグレットのバランスを取る。
  • 分析により、レグレットバウンドがメトリック空間のミンコフスキー次元 $d$ に依存することが示され、Lipschitz損失の下では $\widetilde{O}(T^{(d+1)/(d+2)})$ のバウンドが達成される。
  • 移動コストが、有界なミンコフスキー次元を持つ無限空間において、根本的な複雑性を増加させないことが示され、スイッチングコストなしの既知の下界と一致する。

実験結果

リサーチクエスチョン

  • RQ1行動間の切り替えに既知のメトリックに基づくコストが発生するマルチアームバンディットにおける最適なレグレットは何か?
  • RQ2被覆数で測定されるメトリック空間の内在的幾何的複雑性は、ミニマックスレグレットにどのように影響するか?
  • RQ3SMB(Slowly Moving Bandit)アルゴリズムは、区間メトリックを超えて任意の有限メトリック空間へ一般化可能か?
  • RQ4Lipschitz損失を持つ無限次元メトリック空間において、移動コストを追加すると、オンライン学習の根本的複雑性が増加するか?
  • RQ5連続的メトリック空間における最良のレグレットバウンドは何か?また、それはメトリック空間のミンコフスキー次元とどのように関係するか?

主な発見

  • 有限メトリック空間($k$ 個の行動、複雑性 $\mathcal{C}$)では、$\widetilde{O}(\max\{\mathcal{C}^{1/3}T^{2/3}, \sqrt{kT}\})$ のタイトなレグレットバウンドを確立し、これは達成可能かつ最適である。
  • アルゴリズムは $k$ および $T$ に関して多項式時間で効率的に達成可能であり、ユニットスイッチングコスト($\mathcal{C} = \Theta(k)$)や区間メトリック($\mathcal{C} = \Theta(1)$)に対する先行結果を一般化する。
  • 任意の複雑性 $\mathcal{C}$ を持つメトリックに対して、$\widetilde{\Omega}(\max\{\mathcal{C}^{1/3}T^{2/3}, \sqrt{kT}\})$ の一致する下界が証明され、上界のタイトさが裏付けられる。
  • Lipschitz損失とミンコフスキー次元 $d \geq 1$ を持つ無限メトリック空間では、レグレットが $\widetilde{O}(T^{(d+1)/(d+2)})$ に抑えられ、これはスイッチングコストなしの既知の下界と一致する。
  • 驚くべきことに、有界なミンコフスキー次元を持つ無限空間では、移動コストを追加しても根本的な複雑性は増加せず、スイッチングコストなしのケースと同一のレグレットバウンドが得られる。
  • この結果は、連続的設定におけるレグレットの決定要因として、ミンコフスキー次元によって記述される行動空間の幾何的構造が支配的であることを示唆する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。