Skip to main content
QUICK REVIEW

[論文レビュー] X-Armed Bandits

Sébastien Bubeck, Rémi Munos|arXiv (Cornell University)|Jan 25, 2010
Advanced Bandit Algorithms Research参考文献 19被引用数 6
ひとこと要約

本稿では、腕が一般の可測空間を形成し、平均報酬が既知の類似度関数に関してリプシッツ連続であるXアーマード・バンディット問題に対して、HOO(階層的楽観的最適化)と呼ばれる新しい方策を提案する。腕空間が単位ハイパーキューブであり、報酬関数が局所的滑らかさが既知の有限個のグローバル最大値を持つ場合、HOOは次元に依存しない√nのレグレットバウンドを達成する。また、度量的類似度関数のもとで最小最大最適性を示す。

ABSTRACT

We consider a generalization of stochastic bandits where the set of arms, $\cX$, is allowed to be a generic measurable space and the mean-payoff function is Lipschitz with respect to a dissimilarity function that is known to the decision maker. Under this condition we construct an arm selection policy, called HOO (hierarchical optimistic optimization), with improved regret bounds compared to previous results for a large class of problems. In particular, our results imply that if $\cX$ is the unit hypercube in a Euclidean space and the mean-payoff function has a finite number of global maxima around which the behavior of the function is locally continuous with a known smoothness degree, then the expected regret of HOO is bounded up to a logarithmic factor by $\sqrt{n}$, i.e., the rate of growth of the regret is independent of the dimension of the space. We also prove the minimax optimality of our algorithm when the dissimilarity is a metric. Our basic strategy has quadratic computational complexity as a function of the number of time steps and does not rely on the doubling trick. We also introduce a modified strategy, which relies on the doubling trick but runs in linearithmic time. Both results are improvements with respect to previous approaches.

研究の動機と目的

  • 腕空間が有限またはユークリッド空間に制限されない一般の可測空間であるような確率的バンディット問題に対処すること。
  • 平均報酬関数に構造的仮定を課すことにより、高次元または連続的腕空間におけるレグレットバウンドを改善すること。
  • 報酬関数が局所的滑らかさが既知の有限個のグローバル最大値を持つ場合に、次元に依存しないレグレット成長を達成する方策を開発すること。
  • 度量的類似度関数のもとで、提案手法の最小最大最適性を確立すること。
  • 従来の手法と比較して計算複雑性が改善された効率的なアルゴリズムを設計すること。

提案手法

  • HOO方策は、各ノードが腕の部分集合を表す階層的木構造を用いて腕空間を分割する。
  • 各時刻において、サンプル報酬から導かれる上位信頼区間に基づいた楽観的上位信頼区間(UCB)戦略により腕が選択される。
  • 木の各ノードに対して信頼区間を維持し、上位信頼区間が最大のノードを再帰的に選択することで、有望な領域へと探索を絞り込む。
  • 深さの深いノードはより小さな部分集合を表すように木を構築し、潜在的な最大値の周辺での局所的探索を可能にする。
  • 平均報酬関数の既知の類似度関数に関するリプシッツ性に依存することで、腕間での期待報酬の変動を制限する。
  • 修正版HOOはダブルイング・トリックを用いて計算複雑性を二次時間から線性対数時間に低減するが、実装が多少複雑化する。

実験結果

リサーチクエスチョン

  • RQ1平均報酬関数が局所的滑らかさが既知の有限個のグローバル最大値を持つ場合、次元に依存しない腕空間のレグレット成長を達成できるバンディットアルゴリズムは存在するか?
  • RQ2類似度関数に関して既知のリプシッツ条件が成り立つ場合、Xアーマード・バンディット問題の最適レグレットレートは何か?
  • RQ3類似度関数が度量である場合、提案されたHOO方策は最小最大最適か?
  • RQ4階層的木に基づく探索をどのように効率的に実装すれば、低レグレットかつ管理可能な計算コストを達成できるか?
  • RQ5ダブルイング・トリックは階層的バンディット方策に効果的に適用可能か? これにより時間計算量を低減できるが、レグレット性能に悪影響を与えないか?

主な発見

  • 腕空間が単位ハイパーキューブであり、平均報酬関数が局所的滑らかさが既知の有限個のグローバル最大値を持つ場合、HOOはO(√n)の期待レグレットバウンドを達成する。このバウンドは対数要因を除いて成立する。
  • HOOのレグレットバウンドは腕空間の次元に依存せず、高次元設定において従来手法よりも顕著な改善を示す。
  • 類似度関数が度量である場合、HOOは最小最大最適であり、レグレット成長の理論的下界と一致する。
  • 基本的なHOOアルゴリズムは、時間ステップ数に関して二次の計算複雑性を示すが、ダブルイング・トリックを用いないにもかかわらず、強力なレグレット性能を達成する。
  • ダブルイング・トリックを用いた修正版HOOは、時間計算量を線形対数時間に低減しながらも、同じレグレットバウンドを維持する。これは、効率性と性能の間の実用的な妥協を提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。