Skip to main content
QUICK REVIEW

[論文レビュー] An Optimal Algorithm for Adversarial Bandits with Arbitrary Delays

Julian Zimmert, Yevgeny Seldin|arXiv (Cornell University)|Oct 14, 2019
Advanced Bandit Algorithms Research参考文献 12被引用数 13
ひとこと要約

本稿では、1/2-Tsallisエントロピーと負エントロピーを組み合わせた新しいハイブリッド正則化子を用いた、任意の遅延を持つ敵対的バンディット問題に対して最適な $Ó(\sqrt{kn} + \sqrt{D\log k})$ のリグレットを達成する、いつでも使えるFTRLアルゴリズムを提案する。本研究は、$n$ や $D$ の事前知識が不要であり、二重化スキームを回避し、遅延が不均衡な場合でも遅延の事前知識なしに適応可能な洗練されたスキップ技術を可能にすることで、未解決の問題を解決する。

ABSTRACT

We propose a new algorithm for adversarial multi-armed bandits with unrestricted delays. The algorithm is based on a novel hybrid regularizer applied in the Follow the Regularized Leader (FTRL) framework. It achieves $\mathcal{O}(\sqrt{kn}+\sqrt{D\log(k)})$ regret guarantee, where $k$ is the number of arms, $n$ is the number of rounds, and $D$ is the total delay. The result matches the lower bound within constants and requires no prior knowledge of $n$ or $D$. Additionally, we propose a refined tuning of the algorithm, which achieves $\mathcal{O}(\sqrt{kn}+\min_{S}|S|+\sqrt{D_{\bar S}\log(k)})$ regret guarantee, where $S$ is a set of rounds excluded from delay counting, $\bar S = [n]\setminus S$ are the counted rounds, and $D_{\bar S}$ is the total delay in the counted rounds. If the delays are highly unbalanced, the latter regret guarantee can be significantly tighter than the former. The result requires no advance knowledge of the delays and resolves an open problem of Thune et al. (2019). The new FTRL algorithm and its refined tuning are anytime and require no doubling, which resolves another open problem of Thune et al. (2019).

研究の動機と目的

  • 任意の遅延を持つ敵対的バンディット問題における未解決問題を解決すること。具体的には、時間枠 $n$ や総遅延 $D$ の事前知識の必要性を排除すること。
  • 遅延に適応するアルゴリズムにおいて、二重化スキームの必要性を排除し、いつでも使える性能を実現すること。
  • 遅延の事前知識なしに、大きな遅延を示すラウンドを除外するスキップ機構を開発すること。
  • 不均衡な遅延分布ですら、既知の下界と定数倍以内に一致するリグレットバウンドを達成すること。
  • 除外されたラウンドの数を考慮しないことで、不均衡な遅延パターンに適応する洗練されたリグレット保証を提供すること。

提案手法

  • FTRLフレームワーク内で、1/2-Tsallisエントロピーと負エントロピーを別々の学習率で組み合わせた、新しいハイブリッド正則化子を提案する。
  • 未知の $n$ や $D$ に動的に適応するリセットや二重化を必要としない、いつでも使えるFTRLアルゴリズムを設計する。
  • 遅延の影響を推定したしきい値に基づき、大きな遅延を持つラウンドを遅延カウントから除外するスキップ機構を導入する。
  • 遅延カウントから除外されたラウンドの集合 $S$ 全体に対して $|S| + \sqrt{D_{\bar{S}}\log k}$ を最小化する洗練されたチューニング戦略を採用する。
  • 有効な遅延合計を制限するために、$\tilde{\mathfrak{d}}_t$ を用いた遅延フィードバック寄与度の再帰的推定を採用する。
  • FTRL解析、遅延分解、および除外された集合 $S$ における最適化を組み合わせて、リグレットバウンドを導出する。

実験結果

リサーチクエスチョン

  • RQ1任意の遅延を持つ敵対的バンディット問題に対して、$n$ や $D$ の事前知識が不要な、いつでも使えるFTRLアルゴリズムを設計することは可能か?
  • RQ2二重化やリセットなしに、最適なリグレット $\mathcal{O}(\sqrt{kn} + \sqrt{D\log k})$ を達成することは可能か?
  • RQ3遅延の事前知識なしに、大きな遅延を持つラウンドを除外するスキップ戦略を設計することは可能か?
  • RQ4不均衡な遅延分布下で、標準のバウンドよりも著しくタイトな、洗練されたリグレットバウンド $\mathcal{O}(\sqrt{kn} + \min_S(|S| + \sqrt{D_{\bar{S}}\log k}))$ を達成できるか?
  • RQ5提案されたアルゴリズムは、敵対的環境に加え、おそらく確率的環境にも適応可能か?

主な発見

  • アルゴリズムは $\mathcal{O}(\sqrt{kn} + \sqrt{D\log k})$ のリグレットバウンドを達成し、定数倍の差異を除いて既知の下界と一致する。
  • アルゴリズムはいつでも使えるものであり、二重化やリセットを必要とせず、Thuneら(2019)が提起した未解決問題を解決する。
  • 洗練されたチューニングにより、$\mathcal{O}(\sqrt{kn} + \min_S(|S| + \sqrt{D_{\bar{S}}\log k}))$ のリグレットが達成され、遅延が著しく不均衡な場合に標準バウンドよりも著しくタイトになる。
  • スキップされたラウンド数 $|S|$ は $2\sqrt{\tilde{\mathfrak{D}}_n \log k}$ で有界であり、スキップ機構の効率性が保証される。
  • リグレットバウンドは遅延分布に対してロバストであり、不均衡な場合に適応版が $n$ に依存する部分を改善する。
  • 遅延なしの状況ではTsallis-INFに還元され、確率的設定において対数的リグレットが達成可能である可能性を示唆する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。