[論文レビュー] Nonstochastic Multiarmed Bandits with Unrestricted Delays
本稿では、非確率的マルチアームバンディットにおける非有界な遅延を扱うために、新しいスキップラッパーを備えた遅延付きExp3アルゴリズムを提案する。この手法により、有界な遅延を仮定しないまま、予想されるレグレットバウンド $\mathcal{O}(\sqrt{(KT+D)\ln K})$ を達成する。さらに、遅延が行動時時点で利用可能である場合に、$T$ と $D$ の事前知識を不要にするダブリングスキームを導入し、特定の状況では問題パラメータに対する多項式的改善が得られる洗練されたオракルバウンドを提示する。
We investigate multiarmed bandits with delayed feedback, where the delays need neither be identical nor bounded. We first prove that "delayed" Exp3 achieves the $O(\sqrt{(KT + D)\ln K} )$ regret bound conjectured by Cesa-Bianchi et al. [2019] in the case of variable, but bounded delays. Here, $K$ is the number of actions and $D$ is the total delay over $T$ rounds. We then introduce a new algorithm that lifts the requirement of bounded delays by using a wrapper that skips rounds with excessively large delays. The new algorithm maintains the same regret bound, but similar to its predecessor requires prior knowledge of $D$ and $T$. For this algorithm we then construct a novel doubling scheme that forgoes the prior knowledge requirement under the assumption that the delays are available at action time (rather than at loss observation time). This assumption is satisfied in a broad range of applications, including interaction with servers and service providers. The resulting oracle regret bound is of order $\min_β(|S_β|+β\ln K + (KT + D_β)/β)$, where $|S_β|$ is the number of observations with delay exceeding $β$, and $D_β$ is the total delay of observations with delay below $β$. The bound relaxes to $O (\sqrt{(KT + D)\ln K} )$, but we also provide examples where $D_β\ll D$ and the oracle bound has a polynomially better dependence on the problem parameters.
研究の動機と目的
- 非確率的マルチアームバンディットにおける可変的・非有界な遅延下での、予想されるレグレットバウンドと実際に示されたバウンドのギャップを埋めること。
- 従来のアルゴリズムが有界な遅延または $T$ と $D$ の事前知識を必要としているという制限を克服すること。
- しきい値に基づくスキップメカニズムを用いて、未知の遅延に適応する実用的なアルゴリズムを設計すること。
- 遅延が行動時時点で利用可能であるという仮定のもとで、$T$ と $D$ の事前知識を不要にするダブリングスキームを考案すること。
- $D_\beta \ll D$ の場合に標準バウンドよりも優れた性能を示す、洗練されたオラクルレグレットバウンドを導出すること。
提案手法
- 損失が到着するや否や即座に更新を行う、変更を加えた「遅延付きExp3」アルゴリズムを導入。
- 遅延がしきい値 $\beta$ を超えるラウンドをスキップする「Skipper」と呼ばれるラッパー・アルゴリズムを提案。これにより、基本アルゴリズムが受ける有効な遅延が制限される。
- 遅延フィードバックを伴う指数的重みの洗練された分析を用い、確率のずれを示す補題を導入して、遅延更新の影響を制限。
- 遅延が行動時時点で利用可能であると仮定し、$T$ と $D$ の事前知識がなくても、しきい値 $\beta$ を適応的に調整するダブリングスキームを採用。
- 新たなオラクルレグレットバウンドを導出:$\min_\beta \left(|S_\beta| + \beta\ln K + \frac{KT + D_\beta}{\beta}\right)$、ここで $|S_\beta|$ は遅延が $> \beta$ の観測数、$D_\beta$ は $\beta$ 未満の総遅延。
- 標準的な仮定のもとで、このバウンドが $\mathcal{O}(\sqrt{(KT+D)\ln K})$ に簡略化されることを示し、$D_\beta \ll D$ の場合に著しくタイトになることを確認。
実験結果
リサーチクエスチョン
- RQ1非確率的バンディット設定において、非有界な遅延のもとで、予想されるレグレットバウンド $\mathcal{O}(\sqrt{(KT+D)\ln K})$ を達成できるか。
- RQ2遅延フィードバックのもとで、同じレグレットバウンドを維持しつつ、$T$ と $D$ の事前知識を排除することは可能か。
- RQ3遅延の分布に依存する洗練されたレグレットバウンドを導出できるか、特に大多数の遅延が小さい場合に有効か。
- RQ4遅延が行動時時点で分かっているという仮定は、遅延が観測時まで分からない場合に比べ、より良いレグレット保証を可能にするか。
- RQ5$T$ と $D$ の事前知識がなくても、遅延しきい値を適応的に調整するダブリングスキームを設計できるか。
主な発見
- 遅延が有界で、$T$、$D$、$d_{\text{max}}$ が既知である場合、遅延付きExp3アルゴリズムは予想される $\mathcal{O}(\sqrt{(KT+D)\ln K})$ のレグレットバウンドを達成する。
- Skipperラッパー・アルゴリズムにより、遅延が非有界であっても、遅延がしきい値 $\beta$ を超える観測をスキップすることで、遅延付きExp3の使用が可能になり、同じレグレットバウンドが維持される。
- 遅延が行動時時点で利用可能な場合、ダブリングスキームにより $T$ と $D$ の事前知識が不要となり、洗練されたオラクルレグレットバウンドが達成される。
- 洗練されたオラクルバウンド $\min_\beta \left(|S_\beta| + \beta\ln K + \frac{KT + D_\beta}{\beta}\right)$ は、$D_\beta \ll D$ の場合に $\mathcal{O}(\sqrt{(KT+D)\ln K})$ よりも多項式的に優れている可能性がある。
- 分析により、最悪ケースではレグレットバウンドがタイトであることが示されたが、有利な遅延分布では著しく改善可能であることが判明。
- 本稿では、$D_\beta \ll D$ となる具体的な例を提示し、洗練されたバウンドによる顕著な性能向上の可能性を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。