[論文レビュー] Simultaneously Learning Stochastic and Adversarial Episodic MDPs with Known Transition
本稿では、遷移確率が既知でバンディットフィードバックの下でのエピソード的マーケフ連鎖過程(MDP)を学習するための、『両方の世界の最良』保証を初めて満たすアルゴリズムを提示する。FTRLフレームワーク内に、Tsallisエントロピーとログバリア項を組み合わせた新規ハイブリッド正則化項を導入し、確率的設定では $ω(\log T)$ のリグレット、悪質的設定では $ω(\sqrt{T})$ のリグレットを達成し、腐敗パラメータ $C$ を用いて滑らかに中間的状況に挿入可能である。主な技術的進展は、非対角のヘッシアン正則化項を扱い、その逆行列が複雑であるにもかかわらず、自己バインドリグレット境界を可能にする解析手法の開発である。
This work studies the problem of learning episodic Markov Decision Processes with known transition and bandit feedback. We develop the first algorithm with a ``best-of-both-worlds'' guarantee: it achieves $\mathcal{O}(log T)$ regret when the losses are stochastic, and simultaneously enjoys worst-case robustness with $ ilde{\mathcal{O}}(\sqrt{T})$ regret even when the losses are adversarial, where $T$ is the number of episodes. More generally, it achieves $ ilde{\mathcal{O}}(\sqrt{C})$ regret in an intermediate setting where the losses are corrupted by a total amount of $C$. Our algorithm is based on the Follow-the-Regularized-Leader method from Zimin and Neu (2013), with a novel hybrid regularizer inspired by recent works of Zimmert et al. (2019a, 2019b) for the special case of multi-armed bandits. Crucially, our regularizer admits a non-diagonal Hessian with a highly complicated inverse. Analyzing such a regularizer and deriving a particular self-bounding regret guarantee is our key technical contribution and might be of independent interest.
研究の動機と目的
- 遷移確率が既知のエピソード的MDPにおいて、確率的および悪質的両設定で最適なリグレットを達成する単一のアルゴリズムを開発すること。
- 従来、マルチアームドバンディットにのみ知られていた『両方の世界の最良』保証を、より複雑なエピソード的MDP設定へ拡張すること。
- FTRLが損失構造のタイプ(確率的か悪質的か)を事前に知らない状況でも、両者に適応できる正則化項を設計すること。
- 非対角ヘッシアンを持つ正則化項の解析を行い、オンライン学習における占有測度空間上での自己バインドリグレット境界を達成する技術的革新を明らかにすること。
提案手法
- アルゴリズムは、占有測度空間上でFTRLフレームワークを用い、$-\sum_{s,a} \left(\sqrt{q(s,a)} + \sqrt{q(s) - q(s,a)}\right)$ とログバリア項 $-\sum_{s,a} \log q(s,a)$ を組み合わせたハイブリッド正則化項を導入する。
- このハイブリッド正則化項は、最近のマルチアームドバンディットおよびセミバンディットにおける進展、特に $\nicefrac{1}{2}$-Tsallisエントロピーとログバリア正則化にインspiredされている。
- 核心的な技術的進展は、非分解可能な正則化項に伴う非対角ヘッシアンに対するFTRLリグレット境界の解析であり、これには新規の逆ヘッシアンおよび二次ノルム解析が必要となる。
- アルゴリズムは、損失推定子の二次ノルムが逆ヘッシアンに対して有界であることを示すことで、自己バインドリグレット保証を達成する。この有界性は損失環境に適応する。
- 解析は、状態行動対ごとの再帰的バウンディング技法に依拠し、[27]のマルチアームドバンディットにおけるギャップ条件に類似した条件を用いる。
- 腐敗パラメータ $C$ を導入することで、$\mathcal{O}(\log T)$ と $\widetilde{\mathcal{O}}(\sqrt{T})$ のリグレットの間を滑らかに補間でき、中間的状況では $\widetilde{\mathcal{O}}(\log T + \sqrt{C})$ のリグレットが得られる。
実験結果
リサーチクエスチョン
- RQ1遷移確率が既知のエピソード的MDPにおいて、損失が確率的であれば $\mathcal{O}(\log T)$ のリグレット、悪質的であれば $\widetilde\mathcal{O}(\sqrt{T})$ のリグレットを達成する単一のアルゴリズムは可能か?
- RQ2マルチアームドバンディットにのみ知られていた『両方の世界の最良』保証を、遷移関数が既知のより複雑なエピソード的MDP設定へ拡張することは可能か?
- RQ3非対角ヘッシアンを持つ正則化項をFTRLフレームワークで解析することで、占有測度上でのオンライン学習において自己バインドリグレット境界を達成する方法は何か?
- RQ4どのような正則化項構造が、損失タイプを事前に知らない状況でも、確率的および悪質的両環境に適応可能にするか?
- RQ5腐敗パラメータ $C$ を用いて、確率的および悪質的領域間のリグレット境界を滑らかに補間することは可能か?
主な発見
- 提案アルゴリズムは、損失が確率的である場合に $\mathcal{O}(\log T)$ のリグレットを達成し、確率的MDPにおける最良のギャップ依存境界と一致する。
- 悪質的設定では $\widetilde{\mathcal{O}}(\sqrt{T})$ のリグレットを達成し、悪質的エピソード的MDPにおける最新の水準に一致する。
- 全損失の腐敗量が $C$ で有界である場合、$\widetilde{\mathcal{O}}(\log T + \sqrt{C})$ の滑らかなリグレット補間が得られ、確率的と悪質的領域の間を橋渡しする。
- 主な技術的貢献は、非対角ヘッシアンを持つ新規ハイブリッド正則化項に対する自己バインドリグレット解析であり、本分野で初めての解析である。
- 解析により、損失推定子の逆ヘッシアンに関する二次ノルムが $\mathbb{E}[\|\widehat{\ell}_t\|^2_{\nabla^{-2}\phi_H(q_t)}] \leq 4\sqrt{L|S||A|}$ で有界であることが示され、きめ細やかなリグレット制御が可能になる。
- $\nicefrac{1}{2}$-Tsallisエントロピーとログバリア項を組み合わせたハイブリッド正則化項は、アルゴリズムの安定化と非対角ヘッシアン構造下での自己バインド性の実現に不可欠である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。