[论文解读] Simultaneously Learning Stochastic and Adversarial Episodic MDPs with Known Transition
该论文提出了首个在已知转移概率的 episodic Markov Decision Processes (MDPs) 中,结合 bandit feedback 的 'best-of-both-worlds' 保证的算法。该算法在 FTRL 框架中引入了一种新颖的混合正则化项——受 Tsallis 熵和 log-barrier 项启发——实现了随机设置下的 $ω(\log T)$ 冗余和对抗设置下的 $ω(\sqrt{T})$ 冗余,并通过一个扰动参数 $C$ 实现平滑插值。关键技术突破在于分析了一个具有复杂逆矩阵的非对角 Hessian 正则化项,从而实现了自绑定的冗余界。
This work studies the problem of learning episodic Markov Decision Processes with known transition and bandit feedback. We develop the first algorithm with a ``best-of-both-worlds'' guarantee: it achieves $\mathcal{O}(log T)$ regret when the losses are stochastic, and simultaneously enjoys worst-case robustness with $ ilde{\mathcal{O}}(\sqrt{T})$ regret even when the losses are adversarial, where $T$ is the number of episodes. More generally, it achieves $ ilde{\mathcal{O}}(\sqrt{C})$ regret in an intermediate setting where the losses are corrupted by a total amount of $C$. Our algorithm is based on the Follow-the-Regularized-Leader method from Zimin and Neu (2013), with a novel hybrid regularizer inspired by recent works of Zimmert et al. (2019a, 2019b) for the special case of multi-armed bandits. Crucially, our regularizer admits a non-diagonal Hessian with a highly complicated inverse. Analyzing such a regularizer and deriving a particular self-bounding regret guarantee is our key technical contribution and might be of independent interest.
研究动机与目标
- 开发一种单一算法,在已知转移概率的随机与对抗 episodic MDP 中均实现最优冗余。
- 将此前仅在多臂赌博机中成立的 'best-of-both-worlds' 保证,扩展至更复杂的 episodic MDP 设置。
- 设计一种正则化项,使 FTRL 能够在不预先知晓损失结构的情况下,自适应地应对随机与对抗损失环境。
- 分析一个具有高度复杂逆矩阵的非对角 Hessian 正则化项,这是实现自绑定冗余界的關鍵技術創新。
提出的方法
- 该算法在占用度量空间中使用 Follow-the-Regularized-Leader (FTRL) 框架,利用一种结合 $-\sum_{s,a} \left(\sqrt{q(s,a)} + \sqrt{q(s) - q(s,a)}\right)$ 和 log-barrier 项 $-\sum_{s,a} \log q(s,a)$ 的混合正则化项。
- 该混合正则化项受到近期多臂赌博机与半-bandit 问题中进展的启发,特别是 $\nicefrac{1}{2}$-Tsallis 熵与 log-barrier 正则化。
- 核心技术创新在于分析具有非可分解正则化项的 FTRL 冗余界,其 Hessian 非对角,需采用新颖的逆 Hessian 与二次范数分析方法。
- 通过证明损失估计器关于逆 Hessian 的二次范数以一种自适应方式受控,该算法实现了自绑定冗余保证。
- 分析依赖于对状态-动作对的递归有界技术,使用类似于文献 [27] 中多臂赌博机的间隙条件。
- 通过引入扰动参数 $C$,该方法在 $\mathcal{O}(\log T)$ 与 $\widetilde{\mathcal{O}}(\sqrt{T})$ 冗余之间实现平滑插值,中间设置下的冗余为 $\widetilde{\mathcal{O}}(\log T + \sqrt{C})$。
实验结果
研究问题
- RQ1能否设计一种单一算法,在已知转移概率的随机 episodic MDP 中实现 $\mathcal{O}(\log T)$ 冗余,同时在对抗 MDP 中实现 $\widetilde{\mathcal{O}}(\sqrt{T})$ 冗余?
- RQ2是否能够将多臂赌博机中的 'best-of-both-worlds' 保证扩展到具有已知转移函数的更复杂 episodic MDP 设置?
- RQ3如何在 FTRL 框架中分析具有非对角 Hessian 的正则化项,以在占用度量上的在线学习中实现自绑定冗余界?
- RQ4何种正则化结构能够使算法在不预先知晓损失类型的情况下,自适应地适应随机与对抗损失环境?
- RQ5是否能通过扰动参数 $C$ 实现从随机与对抗模式之间的冗余界平滑插值?
主要发现
- 所提出的算法在损失为随机时实现 $\mathcal{O}(\log T)$ 冗余,与随机 MDP 中已知的最佳间隙依赖界一致。
- 在对抗设置中,该算法实现 $\widetilde{\mathcal{O}}(\sqrt{T})$ 冗余,与对抗 episodic MDP 的最先进水平一致。
- 当总损失扰动受 $C$ 限制时,该算法实现平滑的冗余插值 $\widetilde{\mathcal{O}}(\log T + \sqrt{C})$,弥合了随机与对抗模式之间的差距。
- 关键技术贡献是首次在该背景下对具有非对角 Hessian 的新颖混合正则化项实现自绑定冗余分析。
- 分析表明,损失估计器关于逆 Hessian 的二次范数满足 $\mathbb{E}[\|\widehat{\ell}_t\|^2_{\nabla^{-2}\phi_H(q_t)}] \leq 4\sqrt{L|S||A|}$,从而实现了紧密的冗余控制。
- 结合 $\nicefrac{1}{2}$-Tsallis 熵与 log-barrier 项的混合正则化项,对算法的稳定性及在非对角 Hessian 结构下的自绑定特性至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。