[論文レビュー] No Weighted-Regret Learning in Adversarial Bandits with Delays
本稿では、遅延を伴う敵対的バンディットにおける重み付きのない後悔学習を導入し、大きな遅延によって線形後悔が生じる場合でも、FKMおよびEXP3アルゴリズムが、一般の非協力ゲームにおける粗い協調的均衡(CCE)への重み付き時間平均の収束と、2人零和ゲームにおけるナッシュ均衡への収束を保証することを示している。主な貢献は、未知の遅延においても最適な後悔スケーリングを維持する、新しいダブルイング・トリックの開発であり、未知のゲームにおける遅延付きバンディットフィードバックシミュレーションにおけるロバストな均衡近似を可能にする。
Consider a scenario where a player chooses an action in each round $t$ out of $T$ rounds and observes the incurred cost after a delay of $d_{t}$ rounds. The cost functions and the delay sequence are chosen by an adversary. We show that in a non-cooperative game, the expected weighted ergodic distribution of play converges to the set of coarse correlated equilibria if players use algorithms that have "no weighted-regret" in the above scenario, even if they have linear regret due to too large delays. For a two-player zero-sum game, we show that no weighted-regret is sufficient for the weighted ergodic average of play to converge to the set of Nash equilibria. We prove that the FKM algorithm with $n$ dimensions achieves an expected regret of $O\left(nT^{\frac{3}{4}}+\sqrt{n}T^{\frac{1}{3}}D^{\frac{1}{3}} ight)$ and the EXP3 algorithm with $K$ arms achieves an expected regret of $O\left(\sqrt{\log K\left(KT+D ight)} ight)$ even when $D=\sum_{t=1}^{T}d_{t}$ and $T$ are unknown. These bounds use a novel doubling trick that, under mild assumptions, provably retains the regret bound for when $D$ and $T$ are known. Using these bounds, we show that FKM and EXP3 have no weighted-regret even for $d_{t}=O\left(t\log t ight)$. Therefore, algorithms with no weighted-regret can be used to approximate a CCE of a finite or convex unknown game that can only be simulated with bandit feedback, even if the simulation involves significant delays.
研究の動機と目的
- 大きな遅延の下で線形後悔が生じるため、標準のない後悔アルゴリズムが失敗するマルチエージェントオンライン学習における遅延フィードバックの課題に対処すること。
- 古典的後悔が線形である場合でも、非協力的および零和ゲームにおいて、重み付きのない後悔学習が、それぞれ粗い協調的均衡(CCE)およびナッシュ均衡(NE)への収束を保証することを確立すること。
- 任意の遅延付きオンライン学習アルゴリズムに適用可能な、一般用途のダブルイング・トリックを設計し、未知の時間枠 $T$ および総遅延 $D$ の下で、後悔境界のオーダーの大きさを維持すること。
- Fので、$d_t = O(t\log t)$ などの非有界遅延でも、重み付きのない後悔を達成できることを示し、未知のゲームにおける遅延付きフィードバックシミュレーションへの応用を可能にすること。
- 非定常的で敵対的な環境における古典的後悔よりもよりロバストな性能指標として重み付き後悔を導入することで、遅延付きオンライン学習の理論的基盤を拡張すること。
提案手法
- 遅延フィードバックを考慮する敵対的バンディットにおける重み付き後悔の概念を導入。後悔は、遅延フィードバックを反映する系列によって重み付けされる。
- 未知の $T$ および $D$ の下で、アルゴリズムのパrameter(例:ステップサイズ)を適応的に調整する、新しいダブルイング・トリックを提案。この手法により、後悔境界の漸近的オーダーが維持される。
- $n$ 次元空間におけるFKMアルゴリズムの分析を行い、遅延フィードバック下で期待後悔境界 $O\left(nT^{\frac{3}{4}} + \sqrt{n}T^{\frac{1}{3}}D^{\frac{1}{3}}\right)$ を導出する。
- K本のアームを対象とするEXP3アルゴリズムの分析を行い、期待後悔境界 $O\left(\sqrt{\log K\left(KT + D\right)}\right)$ を導出。ここで $D = \sum_{t=1}^T \min\{d_t, T-t+1\}$ である。
- 重み系列がステップサイズ系列と一致する場合、FKMおよびEXP3が、$d_t = O(t\log t)$ などの非有界遅延下でも重み付きのない後悔を達成することを示した。
- 重み付きのない後悔が、すべてのプレイヤーが重み付きのない後悔アルゴリズムを使用する場合、期待重み付き時間平均の収束が一般の非協力ゲームにおけるCCEの集合へ、および2人零和ゲームにおけるNEの集合へ、$L^1$ 収束を示す。
実験結果
リサーチクエスチョン
- RQ1古典的後悔が遅延のため線形である場合でも、非協力ゲームにおいて重み付きのない後悔学習が、粗い協調的均衡(CCE)への収束をもたらすか?
- RQ22人零和ゲームにおいて、遅延フィードバック下で重み付きのない後悔が、ナッシュ均衡(NE)への収束をもたらすか?
- RQ3未知の $T$ および $D$ の下で、遅延付きオンライン学習において最適な後悔スケーリングを維持するダブルイング・トリックを設計可能か?
- RQ4Fので、$d_t = O(t\log t)$ などの非有界遅延列下でも、古典的後悔が線形であっても、重み付きのない後悔を達成できるか?
- RQ5重み付き後悔の枠組みを内部後悔へ拡張し、遅延フィードバック設定において協調的均衡を近似可能か?
主な発見
- 提案されたダブルイング・トリックのおかげで、$T$ および $D$ が未知であっても、FKMアルゴリズムは遅延フィードバック下で期待後悔 $O\left(nT^{\frac{3}{4}} + \sqrt{n}T^{\frac{1}{3}}D^{\frac{1}{3}}\right)$ を達成する。
- EXP3アルゴリズムは、$T$ および $D$ が未知であっても、ダブルイング・トリックにより、期待後悔 $O\left(\sqrt{\log K\left(KT + D\right)}\right)$ を達成し、後悔境界のオーダーの大きさが維持される。
- $d_t = O(t\log t)$ のような非有界遅延下でも、古典的後悔が線形であっても、FKMおよびEXP3は、ステップサイズ系列を重みとして用いることで重み付きのない後悔を達成でき、均衡への収束が可能になる。
- すべてのプレイヤーが重み付きのない後悔アルゴリズムを使用する場合、プレイの期待重み付き時間平均は、一般の非協力ゲームにおいて粗い協調的均衡(CCE)の集合へ収束する。
- 2人零和ゲームでは、プレイヤーが重み付きのない後悔アルゴリズムを使用する場合、プレイの重み付き時間平均が $L^1$ 収束してナッシュ均衡の集合へ収束する。
- 提案されたダブルイング・トリックは、即座に適用可能であり、$T$ および $D$ が未知であっても、後悔境界の漸近的依存関係を保証する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。