Skip to main content
QUICK REVIEW

[論文レビュー] Unimodal Bandits without Smoothness

Richard Combes, Alexandre Proutière|arXiv (Cornell University)|Jun 28, 2014
Advanced Bandit Algorithms Research参考文献 20被引用数 13
ひとこと要約

本稿では、連続的で単峰性であるが、滑らかでない可能性がある報酬関数を想定した連続的アームを有する単峰性バンディット問題に対して、Stochastic Pentachotomy (SP) アルゴリズムを提案する。SPは、最適なアームを含む区間を段階的に縮小するための逐次的統計的検定を用い、報酬関数の滑らかさパラメータ $ξ$ や $C$ を事前に知らないままに、$O(\sqrt{T\log T})$ の順序最適なリグレットと $O(\sqrt{\log T / T})$ の最適化誤差を達成する。この方法は、滑らかでないか、滑らかさが未知の報酬関数に対しても、初めてそのスケーリングを達成した。

ABSTRACT

We consider stochastic bandit problems with a continuous set of arms and where the expected reward is a continuous and unimodal function of the arm. No further assumption is made regarding the smoothness and the structure of the expected reward function. For these problems, we propose the Stochastic Pentachotomy (SP) algorithm, and derive finite-time upper bounds on its regret and optimization error. In particular, we show that, for any expected reward function $μ$ that behaves as $μ(x)=μ(x^\star)-C|x-x^\star|^ξ$ locally around its maximizer $x^\star$ for some $ξ, C>0$, the SP algorithm is order-optimal. Namely its regret and optimization error scale as $O(\sqrt{T\log(T)})$ and $O(\sqrt{\log(T)/T})$, respectively, when the time horizon $T$ grows large. These scalings are achieved without the knowledge of $ξ$ and $C$. Our algorithm is based on asymptotically optimal sequential statistical tests used to successively trim an interval that contains the best arm with high probability. To our knowledge, the SP algorithm constitutes the first sequential arm selection rule that achieves a regret and optimization error scaling as $O(\sqrt{T})$ and $O(1/\sqrt{T})$, respectively, up to a logarithmic factor for non-smooth expected reward functions, as well as for smooth functions with unknown smoothness.

研究の動機と目的

  • 報酬関数の滑らかさが未知または存在しない場合の連続的アームを有する単峰性バンディット最適化の課題に対処すること。
  • リグレットと最適化誤差のスケーリングを最適化するアルゴリズムを設計し、リプシッツ連続性や微分可能性といった滑らかさの仮定に依存しないこと。
  • 最小限の構造的仮定のもとで、既知の下界と達成可能な性能のギャップを埋めること。
  • 最適なアームを高確率で含む区間を逐次的に縮小するフレームワークを構築すること。
  • $O(\sqrt{T\log T})$ のリグレットと $O(\sqrt{\log T / T})$ の最適化誤差を、滑らでないものを含む広範な単峰性報酬関数のクラスに対して達成すること。

提案手法

  • SPアルゴリズムは、最適なアームを高確率で含む区間を維持し、逐次的統計的検定を用いてそのサイズを段階的に縮小する。
  • 各区間縮小ステップでは、区間内に少なくとも3つのアームをサンプリングすることで、区間を狭めるための十分な統計的証拠を収集する逐次的検定が用いられる。
  • 有限時間における逐次的検定のサンプリング複雑度の下界(ミニマックスリスクを保証)を用い、この下界を達成する最適な検定を設計する。
  • 逐次的検定は、カルバック・ライブラー発散と集中不等式に基づき、誤差確率を制御し、高信頼性の区間縮小を保証する。
  • ゴールデンセクション探索や二点サンプリングに依存しない。これらは、滑らでない状況では最適なスケーリングを達成できないことが示されている。
  • 報酬関数 $\mu(x) = \mu(x^\star) - C|x - x^\star|^\xi$ の局所的挙動に適応するが、$\xi$ や $C$ の知識を必要としない。

実験結果

リサーチクエスチョン

  • RQ1滑らかさの仮定や滑らかさパラメータ $\xi$ の知識がない状況でも、単峰性報酬関数に対して順序最適なリグレットと最適化誤差を達成できるバンディットアルゴリズムは存在するか?
  • RQ2最適なアームを高確率で含む状態を維持しつつ、サンプリングコストを最小限に抑える逐次的区間縮小手順を設計することは可能か?
  • RQ3ゴールデンセクション探索のような二点サンプリング戦略が、滑らでない状況ではなぜ最適なリグレットスケーリングを達成できないのか?
  • RQ4区間縮小ステップごとに必要な最小内部サンプル数はいくつか?
  • RQ5与えられたミニマックスリスクに対して、有限時間におけるサンプリング複雑度の下界を達成する逐次的検定を構築できるか?

主な発見

  • SPアルゴリズムは、任意の単峰性かつ連続的報酬関数に対して、$\mu(x) = \mu(x^\star) - C|x - x^\star|^\xi$ のように最大値近傍で振る舞うものについて、$\xi$ や $C$ の知識がなくても $O(\sqrt{T\log T})$ のリグレットスケーリングを達成する。
  • SPアルゴリズムの最適化誤差は $O(\sqrt{\log T / T})$ にスケーリングされ、既知の下界と対数因子を除いて一致する。
  • 滑らでない場合と滑らかな場合の両方において、SPアルゴリズムは順序最適であり、滑らかさの知識を必要とする既存の手法を上回る性能を示す。
  • カルバック・ライブラー発散と集中不等式に基づく逐次的検定は、サンプリング複雑度の観点で最適であり、有限時間における下界と一致することが示された。
  • 本研究では、区間ごとに2つのアームのみをサンプリングする(ゴールデンセクション探索のように)ことは、最適なリグレットスケーリングを達成するには不十分であることが証明された。少なくとも3つの内部サンプルが必要である。
  • 数値実験により、滑らかさが既知であると仮定する既存のアルゴリズムと比較して、SPは特に滑らでない状況において顕著に優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。