Skip to main content
QUICK REVIEW

[論文レビュー] Efficient-UCBV: An Almost Optimal Algorithm using Variance Estimates

Subhojyoti Mukherjee, K. P. Naveen|arXiv (Cornell University)|Nov 9, 2017
Advanced Bandit Algorithms Research被引用数 16
ひとこと要約

本稿では、分散推定とアーム除去を統合することで、近似的に最適なレグレットバウンドを達成する、効率的なUCBベースのアルゴリズムEUCBVを提案する。分散に配慮した信頼区間と積極的な探索、非一様なアーム選択を組み合わせることで、EUCBVはギャップに依存しないレグレットとして$O(\sqrt{KT})$、ギャップに依存するレグレットとして$O\left(\frac{K\sigma^{2}_{\text{max}}\log(T\Delta^{2}/K)}{\Delta}\right)$を達成し、広範な実験においてUCB1、UCBV、MOSS、OCUCBを上回る性能を発揮する。

ABSTRACT

We propose a novel variant of the UCB algorithm (referred to as Efficient-UCB-Variance (EUCBV)) for minimizing cumulative regret in the stochastic multi-armed bandit (MAB) setting. EUCBV incorporates the arm elimination strategy proposed in UCB-Improved \citep{auer2010ucb}, while taking into account the variance estimates to compute the arms' confidence bounds, similar to UCBV \citep{audibert2009exploration}. Through a theoretical analysis we establish that EUCBV incurs a \emph{gap-dependent} regret bound of {\scriptsize $O\left( \dfrac{Kσ^2_{\max} \log (TΔ^2 /K)}Δ ight)$} after $T$ trials, where $Δ$ is the minimal gap between optimal and sub-optimal arms; the above bound is an improvement over that of existing state-of-the-art UCB algorithms (such as UCB1, UCB-Improved, UCBV, MOSS). Further, EUCBV incurs a \emph{gap-independent} regret bound of {\scriptsize $O\left(\sqrt{KT} ight)$} which is an improvement over that of UCB1, UCBV and UCB-Improved, while being comparable with that of MOSS and OCUCB. Through an extensive numerical study we show that EUCBV significantly outperforms the popular UCB variants (like MOSS, OCUCB, etc.) as well as Thompson sampling and Bayes-UCB algorithms.

研究の動機と目的

  • 確率的マルチアームバンディット問題における累積レグレットを最小化するバンディットアルゴリズムの開発。
  • 信頼区間への分散推定の統合により、既存のUCB変種を改善すること。
  • 順序的に最適または近似的に最適なギャップ依存およびギャップ非依存のレグレットバウンドを達成すること。
  • MOSS、OCUCB、トムソンサンプリングなどの最先端アルゴリズムを、多様な実験環境で上回ること。
  • 長期間にわたる実行や高分散の最適アームを伴う状況でも良好に動作する安定的で分散に配慮したアルゴリズムの設計。

提案手法

  • EUCBVは、UCBVと同様に分散推定を用いて各アームの信頼区間をより厳密に計算する。
  • UCB-Improvedからのアーム除去戦略を適用し、探索の後続ラウンドで劣悪なアームを除去する。
  • 分散と信頼区間を基に非一様なアーム選択を実施し、不確実性が高く、より高い報酬の可能性があるアームを優先する。
  • 積極的な探索パrameterと分散に配慮した信頼区間を組み合わせることで、劣悪なアームの除去を加速する。
  • 信頼区間は各アームの実測平均と実測分散の両方を組み込む。
  • アルゴリズムはホライズン$T$を入力として必要とし、$T \geq K^{2.4}$の条件下で最適なレグレットを達成することを設計している。

実験結果

リサーチクエスチョン

  • RQ1分散推定をUCBスタイルのアルゴリズムに効果的に統合することで、レグレットバウンドの改善が可能か?
  • RQ2アーム除去と分散に配慮した信頼区間を組み合わせることで、既存の最先端アルゴリズムよりも優れた実験的性能が得られるか?
  • RQ3UCB変種がUCB1およびUCBVよりも、順序的に最適なギャップ非依存レグレットと改善されたギャップ依存レグレットを両方達成できるか?
  • RQ4ギャップが小さく、最適アームの分散が大きい環境では、EUCBVはベイジアン手法が失敗する状況でも効果的か?
  • RQ5大規模なホライズンと多数のアームを伴う状況では、EUCBVはトムソンサンプリングやベイズ-UCBよりも安定的かつスケーラブルか?

主な発見

  • EUCBVはギャップ非依存レグレットバウンドとして$O(\sqrt{KT})$を達成し、MOSSおよびOCUCBの最良知られているバウンドと一致する。
  • ギャップ依存レグレットバウンドは$O\left(\frac{K\sigma^{2}_{\text{max}}\log(T\Delta^{2}/K)}{\Delta}\right)$であり、UCB1、UCBV、UCB-Improvedを上回る。
  • 100アームと高分散の最適アームを伴う実験では、EUCBVはTS-G、BU-G、UCBV、MOSS、OCUCBを著しく上回った。
  • 積極的な探索と非一様なアーム選択戦略のおかげで、EUCBVは分散に配慮したアルゴリズムであるUCBVを凌駕した。
  • 3つの分散グループを持つ均一ギャップ設定では、EUCBVはTS-G、MOSS、BU-G、OCUCB、UCBVよりもはるかに遅いレグレット増加を示した。
  • ベイジアンアルゴリズムであるTS-GとBU-Gは高分散最適アームの状況で失敗したが、EUCBVは安定的かつ効果的であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。