Skip to main content
QUICK REVIEW

[論文レビュー] Double Explore-then-Commit: Asymptotic Optimality and Beyond

Tianyuan Jin, Pan Xu|arXiv (Cornell University)|Feb 21, 2020
Advanced Bandit Algorithms Research参考文献 35被引用数 7
ひとこと要約

本稿では、漸近的最適性を達成しながらも定数のラウンド複雑性を維持する、新しいバッチ化マルチアームバンディットアルゴリズムであるダブル・エクスプロア・スイッチ(DETC)を提案する。2つの異なる探索フェーズを経てから活用に移ることで、従来のETC戦略の非最適性を克服し、UCBのような完全に逐次的なアルゴリズムの漸近的レジットバウンドに一致させることに成功し、これが非完全に逐次的な手法としては初めての達成である。

ABSTRACT

We study the multi-armed bandit problem with subgaussian rewards. The explore-then-commit (ETC) strategy, which consists of an exploration phase followed by an exploitation phase, is one of the most widely used algorithms in a variety of online decision applications. Nevertheless, it has been shown in Garivier et al. (2016) that ETC is suboptimal in the asymptotic sense as the horizon grows, and thus, is worse than fully sequential strategies such as Upper Confidence Bound (UCB). In this paper, we show that a variant of ETC algorithm can actually achieve the asymptotic optimality for multi-armed bandit problems as UCB-type algorithms do and extend it to the batched bandit setting. Specifically, we propose a double explore-then-commit (DETC) algorithm that has two exploration and exploitation phases and prove that DETC achieves the asymptotically optimal regret bound. To our knowledge, DETC is the first non-fully-sequential algorithm that achieves such asymptotic optimality. In addition, we extend DETC to batched bandit problems, where (i) the exploration process is split into a small number of batches and (ii) the round complexity is of central interest. We prove that a batched version of DETC can achieve the asymptotic optimality with only a constant round complexity. This is the first batched bandit algorithm that can attain the optimal asymptotic regret bound and optimal round complexity simultaneously.

研究の動機と目的

  • サブガウス型報酬を有するマルチアームバンディット問題における、標準的エクスプロア・スイッチ(ETC)戦略の非最適性を解消すること。
  • 漸近的レジット最適性と最小限のラウンド複雑性を両立するバッチ化バンディットアルゴリズムを設計すること。
  • 2段階の探索戦略が、UCB型アルゴリズムのような漸近的レジット性能に達することを示すこと。
  • 非完全に逐次的なアルゴリズムに対して、バッチ化バンディット設定において最適な性能を示す理論的保証を確立すること。

提案手法

  • 2つの別々の探索フェーズに続いて1回の活用フェーズをとるダブル・エクスプロア・スイッチ(DETC)アルゴリズムを提案する。
  • 最初の探索フェーズでデータに依存する停止時刻を用い、高い信頼性でアームの平均値を推定する。
  • 2番目の探索フェーズで推定値を精緻化し、最良のアームにコミットする前の不確実性を低減する。
  • 濃度不等式とピーリング技術を用いて、誤ったアーム選択の確率をバウンドする。
  • LaiとRobbins(1985)およびGarivierら(2016)の下界に一致するレジットバウンドを導出する。この導出は、ギャップパラメータが既知または未知の場合に適用可能である。
  • アルゴリズムを少数のラウンドに構造化することで、DETCをバッチ化バンディット設定に拡張し、定数のラウンド複雑性を達成する。

実験結果

リサーチクエスチョン

  • RQ1サブガウス型報酬を有するマルチアームバンディット問題において、2段階のエクスプロア・スイッチ戦略が漸近的最適性を達成できるか?
  • RQ2完全に逐次的でないバンディットアルゴリズムを設計し、UCB型アルゴリズムの漸近的レジットバウンドに一致させることは可能か?
  • RQ3バッチ化バンディットアルゴリズムは、漸近的レジット最適性と定数のラウンド複雑性を両立できるか?
  • RQ4バッチ化バンディット問題において、漸近的最適性を達成するために必要な最小のラウンド複雑性は何か?
  • RQ5ETC戦略における単一の探索フェーズと比較して、2つの探索フェーズがレジット性能をどのように改善できるか?

主な発見

  • Δ_i が未知の場合、DETCは $\sum_{i:\Delta_i > 0} \frac{2}{\Delta_i}$ の漸近的レジットバウンドを達成し、LaiとRobbins(1985)の下界に一致する。
  • Δ_i が既知の場合、DETCはGarivierら(2016)が確立したよりタイトな下界 $\sum_{i:\Delta_i > 0} \frac{1}{2\Delta_i}$ を達成する。
  • DETCは、サブガウス型報酬を有するマルチアームバンディット設定において、漸近的最適性を達成する非完全に逐次的アルゴリズムとして初のものである。
  • バッチ化されたDETCは、たとえ定数のラウンド複雑性であっても、漸近的最適性を達成する。これは文献において初の成果である。
  • バッチ化DETCのレジットバウンドは $O(\log T)$ であり、最適レートに一致する。また、ラウンド複雑性は $O(1)$ であり、Tに依存しない。
  • 理論的解析により、非最適なアームが選択される確率が $O(1/(T\delta^2))$ でバウンドされ、最適なアームの高信頼性選択が保証される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。