[论文解读] Distributional Robustness and Regularization in Reinforcement Learning
本文通过引入Wasserstein分布鲁棒MDP,建立了分布鲁棒强化学习与正则化之间的对偶关系,提供了有限样本的分布外性能保证。证明了对经验价值函数的新正则化项可下界化鲁棒价值函数,从而在强化学习中实现对外部不确定性的实际鲁棒性,并具备理论泛化保证。
Distributionally Robust Optimization (DRO) has enabled to prove the equivalence between robustness and regularization in classification and regression, thus providing an analytical reason why regularization generalizes well in statistical learning. Although DRO's extension to sequential decision-making overcomes $ extit{external uncertainty}$ through the robust Markov Decision Process (MDP) setting, the resulting formulation is hard to solve, especially on large domains. On the other hand, existing regularization methods in reinforcement learning only address $ extit{internal uncertainty}$ due to stochasticity. Our study aims to facilitate robust reinforcement learning by establishing a dual relation between robust MDPs and regularization. We introduce Wasserstein distributionally robust MDPs and prove that they hold out-of-sample performance guarantees. Then, we introduce a new regularizer for empirical value functions and show that it lower bounds the Wasserstein distributionally robust value function. We extend the result to linear value function approximation for large state spaces. Our approach provides an alternative formulation of robustness with guaranteed finite-sample performance. Moreover, it suggests using regularization as a practical tool for dealing with $ extit{external uncertainty}$ in reinforcement learning methods.
研究动机与目标
- 通过形式化分布鲁棒性与正则化之间的对偶关系,弥合鲁棒强化学习与正则化之间的差距。
- 通过构建基于Wasserstein的距离的模糊集,解决MDP中的外部不确定性(如模型误设)问题,涵盖转移和奖励分布。
- 通过分布鲁棒优化方法,为鲁棒强化学习策略提供有限样本的分布外性能保证。
- 将鲁棒性-正则化对偶性扩展至大规模状态空间的线性价值函数近似。
- 提出一种实用的正则化项,通过模仿分布鲁棒策略的行为,增强强化学习中的泛化能力。
提出的方法
- 提出基于Wasserstein模糊集的分布鲁棒MDP,中心位于经验转移和奖励分布上。
- 定义一种作用于经验价值函数的新正则化项,该正则化项可下界化分布鲁棒策略的价值。
- 利用分布鲁棒优化的对偶形式,推导出序列决策中鲁棒性与正则化之间的联系。
- 通过压缩映射论证和集中不等式,推导出鲁棒价值函数的有限样本概率保证。
- 通过推导一个正则化目标,将该框架扩展至线性函数近似,确保在参数化价值函数下仍保持鲁棒性。
- 采用基于半径的模糊集,通过Wasserstein距离定义,其半径根据样本量和置信水平进行校准。
实验结果
研究问题
- RQ1能否在理论上将分布鲁棒MDP与强化学习中的正则化建立联系?
- RQ2对经验价值函数的正则化项是否可提供对分布鲁棒价值函数的下界?
- RQ3在Wasserstein分布鲁棒性下训练的策略,可推导出哪些有限样本性能保证?
- RQ4如何将鲁棒性与正则化之间的对偶性扩展至线性价值函数近似?
- RQ5所提出的正则化项能否作为直接求解复杂鲁棒MDP的实用替代方案?
主要发现
- 所提出的对经验价值函数的正则化项可下界化Wasserstein分布鲁棒策略的价值,建立了正则化与鲁棒性之间的直接对偶关系。
- 该方法提供了有限样本的分布外性能保证:以高概率,任何位于模糊集内的真实分布下的期望回报均被鲁棒价值函数下界所约束。
- 该概率保证在所有状态上一致成立,失败概率被控制在ε以内,该界由经验分布上的集中不等式推导得出。
- 对于线性价值函数近似,正则化目标保持了相同的鲁棒性特性,从而可扩展至大规模状态空间。
- Wasserstein模糊集的半径通过样本量和置信水平进行校准,确保真实分布以高概率落在该集合内。
- 该框架表明,正则化可作为求解计算困难的鲁棒MDP的实用代理,尤其在数据稀缺场景下更具优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。