[论文解读] A Model Selection Approach for Corruption Robust Reinforcement Learning
该论文提出了一种强化学习模型选择框架,在转移和奖励均遭受对抗性污染且未知污染程度C的情况下,实现了最优后悔边界。通过在针对不同污染水平调优的基线算法之间实现后悔平衡,该方法在表格型MDP中达到最坏情况下的最优后悔边界$ otimes\mathcal{O}}(\min\{1/\Delta, \sqrt{T}\} + C)$,在线性MDP中达到$ olimits\mathcal{O}}(\sqrt{(1+C)T})$,解决了关于污染鲁棒强化学习的一个开放问题。
We develop a model selection approach to tackle reinforcement learning with adversarial corruption in both transition and reward. For finite-horizon tabular MDPs, without prior knowledge on the total amount of corruption, our algorithm achieves a regret bound of $\widetilde{\mathcal{O}}(\min\{\frac{1}Δ, \sqrt{T}\}+C)$ where $T$ is the number of episodes, $C$ is the total amount of corruption, and $Δ$ is the reward gap between the best and the second-best policy. This is the first worst-case optimal bound achieved without knowledge of $C$, improving previous results of Lykouris et al. (2021); Chen et al. (2021); Wu et al. (2021). For finite-horizon linear MDPs, we develop a computationally efficient algorithm with a regret bound of $\widetilde{\mathcal{O}}(\sqrt{(1+C)T})$, and another computationally inefficient one with $\widetilde{\mathcal{O}}(\sqrt{T}+C)$, improving the result of Lykouris et al. (2021) and answering an open question by Zhang et al. (2021b). Finally, our model selection framework can be easily applied to other settings including linear bandits, linear contextual bandits, and MDPs with general function approximation, leading to several improved or new results.
研究动机与目标
- 解决在转移和奖励均遭受对抗性污染且总污染量C未知时,实现强化学习中最优后悔边界的开放问题。
- 开发一种模型选择框架,自适应地在针对不同假设污染水平设计的基线算法中进行选择。
- 实现与T(训练轮数)和C(污染量)均最优相关的最坏情况后悔边界,匹配信息论下界。
- 将该框架扩展至线性MDP及其他场景(如线性Bandits和上下文Bandits),在这些场景中获得改进或全新的理论保证。
提出的方法
- 该方法使用一种元算法COBE(通过平衡与消除实现污染鲁棒性),维护多个针对不同估计污染水平调优的基线算法实例。
- 通过精心选择的重要权重$\alpha_i$实现后悔平衡,确保各基线算法的性能保持可比,防止任一算法被过度惩罚。
- 在每个基线算法实例提前终止后,动态提高估计的污染水平$k$,表明当前估计过低。
- 该框架依赖一个子程序BASIC,通过累积后悔和置信区间设定停止条件,在污染假设的层次结构中执行模型选择。
- 采用形式为$\mathcal{R}(t,\theta) = \sqrt{\beta_1 t} + \beta_2 \theta + \beta_3$的参数化后悔边界,以建模不同污染假设下基线算法的性能。
- 该方法确保总体后悔在真实污染水平未知的情况下,仍保持在最优基线算法后悔的多对数因子范围内。
实验结果
研究问题
- RQ1在总污染量C未知时,能否为表格型MDP实现T和C均最优的后悔边界?
- RQ2能否设计一种模型选择框架,自适应地识别出正确的污染水平而无需事先知晓,同时保持近似最优的后悔?
- RQ3所提出的方法能否扩展至线性MDP,以实现形式为$\widetilde{\mathcal{O}}(\sqrt{(1+C)T})$的最优后悔边界?
- RQ4该模型选择框架在相关场景(如线性Bandits和上下文Bandits)中是否能获得改进或新的结果?
- RQ5该框架能否在不事先知晓C的情况下,实现形式为$\widetilde{\mathcal{O}}(\min\{1/\Delta, \sqrt{T}\} + C)$的实例相关后悔边界?
主要发现
- 对于有限horizon的表格型MDP,所提算法实现了$\widetilde{\mathcal{O}}(\min\{1/\Delta, \sqrt{T}\} + C)$的后悔边界,这是在未知C的情况下首次实现最坏情况最优边界的成果。
- 该边界与Wu等人(2021)建立的信息论下界一致,解决了污染鲁棒强化学习领域长期存在的开放问题。
- 对于有限horizon的线性MDP,该算法通过计算高效的变体实现了$\widetilde{\mathcal{O}}(\sqrt{(1+C)T})$的后悔边界,优于先前工作。
- 该框架回答了Zhang等人(2021)关于线性MDP中C的最优依赖关系的开放问题。
- 该方法可推广至线性Bandits、线性上下文Bandits以及具有通用函数近似的MDP,这些场景中均获得了改进或全新的后悔边界。
- 该模型选择方法确保即使真实污染水平未知,其后悔仍保持在最优基线算法后悔的多对数因子范围内。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。