[论文解读] Twice regularized MDPs and the equivalence between robustness and regularization
本文提出了双重正则化马尔可夫决策过程(R²MDPs),通过证明具有不确定转移和奖励的鲁棒MDP与具有值和策略相关正则化项的正则化MDP等价,从而在强化学习中统一了鲁棒性与正则化。关键贡献在于建立了鲁棒优化与正则化之间的理论等价性,使得利用标准正则化算法能够高效地进行具有鲁棒性保证的策略迭代。
Robust Markov decision processes (MDPs) aim to handle changing or partially known system dynamics. To solve them, one typically resorts to robust optimization methods. However, this significantly increases computational complexity and limits scalability in both learning and planning. On the other hand, regularized MDPs show more stability in policy learning without impairing time complexity. Yet, they generally do not encompass uncertainty in the model dynamics. In this work, we aim to learn robust MDPs using regularization. We first show that regularized MDPs are a particular instance of robust MDPs with uncertain reward. We thus establish that policy iteration on reward-robust MDPs can have the same time complexity as on regularized MDPs. We further extend this relationship to MDPs with uncertain transitions: this leads to a regularization term with an additional dependence on the value function. We finally generalize regularized MDPs to twice regularized MDPs (R${}^2$ MDPs), i.e., MDPs with $ extit{both}$ value and policy regularization. The corresponding Bellman operators enable developing policy iteration schemes with convergence and robustness guarantees. It also reduces planning and learning in robust MDPs to regularized MDPs.
研究动机与目标
- 通过证明鲁棒性可通过正则化实现,弥合鲁棒MDP与正则化MDP之间的差距。
- 开发一种能够捕捉转移和奖励动态不确定性的正则化框架。
- 建立鲁棒优化问题与凸正则化优化问题之间的理论等价性。
- 设计R²贝尔曼算子,确保收敛性和鲁棒性,同时保持计算效率。
- 利用标准正则化MDP求解器实现鲁棒MDP中的规划与学习。
提出的方法
- 将鲁棒MDP形式化为在不确定集上的最大最小问题,并证明其等价于一个凸正则化优化问题。
- 推导出依赖于不确定集的正则化函数Ω𝒰,该函数同时整合了值和策略正则化。
- 提出双重正则化(R²)贝尔曼算子,将正则化项嵌入贝尔曼更新中。
- 对于球形约束的不确定集,推导出正则化函数的显式形式,并保证收缩性。
- 将该框架扩展至(s,a)-矩形不确定集,得到一种具有显式动作相关正则化的新型R²算子。
- 证明R²贝尔曼算子具有确定性最优策略,从而支持高效的策略迭代。
实验结果
研究问题
- RQ1具有不确定转移和奖励的鲁棒MDP能否被重新表述为正则化MDP?
- RQ2诱导MDP中鲁棒性的正则化函数的精确形式是什么?
- RQ3所提出的正则化框架是否保持了标准策略迭代的收敛性和稳定性?
- RQ4通过将鲁棒MDP重述为正则化问题,能否降低其计算复杂度?
- RQ5R²贝尔曼算子如何在保持可处理性的同时确保鲁棒性?
主要发现
- 在不确定条件下的鲁棒值函数等价于一个具有值和策略相关正则化项的凸正则化优化问题的解。
- 对于球形约束的不确定集,正则化函数具有显式形式,并确保R²贝尔曼算子的收缩性。
- 针对(s,a)-矩形不确定集的R²贝尔曼算子可导出确定性最优策略,从而支持高效的策略迭代。
- 数值实验表明,鲁棒值函数与普通值函数之间的距离随不确定集大小增加而增大,验证了鲁棒性缩放的有效性。
- 在奖励鲁棒性情况下,鲁棒MPI与R²MPI一致,但在转移不确定性下出现分歧,表明R²正则化更准确地捕捉了转移鲁棒性。
- 该等价性使得可通过标准正则化MDP算法求解鲁棒MDP,显著提升了可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。