Skip to main content
QUICK REVIEW

[论文解读] A Dual Approach to Constrained Markov Decision Processes with Entropy Regularization

Donghao Ying, Yuhao Ding|arXiv (Cornell University)|Oct 17, 2021
Reinforcement Learning in Robotics参考文献 28被引用 4
一句话总结

该论文提出了一种针对软最大参数化下熵正则化约束马尔可夫决策过程(CMDPs)的双重方法,利用平滑拉格朗日对偶性实现加速收敛。它引入了一种投影加速梯度下降法来更新对偶变量,并在内层循环中采用自然策略梯度法,实现了对最优性差距和约束违反度的全局收敛速率 $\widetilde{\mathcal{O}}(1/T)$。

ABSTRACT

We study entropy-regularized constrained Markov decision processes (CMDPs) under the soft-max parameterization, in which an agent aims to maximize the entropy-regularized value function while satisfying constraints on the expected total utility. By leveraging the entropy regularization, our theoretical analysis shows that its Lagrangian dual function is smooth and the Lagrangian duality gap can be decomposed into the primal optimality gap and the constraint violation. Furthermore, we propose an accelerated dual-descent method for entropy-regularized CMDPs. We prove that our method achieves the global convergence rate $\widetilde{\mathcal{O}}(1/T)$ for both the optimality gap and the constraint violation for entropy-regularized CMDPs. A discussion about a linear convergence rate for CMDPs with a single constraint is also provided.

研究动机与目标

  • 从优化角度建立熵正则化在约束MDP中理论有效性的目标。
  • 分析在Slater条件和探索性初始分布下拉格朗日对偶函数的平滑性。
  • 为熵正则化CMDPs开发一种具有可证明收敛速率的全局收敛算法。
  • 将分析扩展至单约束CMDPs,表明基于二分法的对偶方法可实现线性收敛。

提出的方法

  • 利用熵正则化在软最大策略参数化下诱导拉格朗日对偶函数的平滑性。
  • 采用投影加速梯度下降法更新对偶变量(拉格朗日乘子)。
  • 在内层循环中使用自然策略梯度法,为每个对偶迭代优化原始策略。
  • 建立一个夹逼不等式,利用折扣熵正则化项界定对偶间隙。
  • 应用强对偶性和性能差异引理,将原始最优性差距和约束违反度与对偶间隙关联起来。
  • 将正则化问题视为标准CMDP的热启动,当正则化权重 $\tau$ 较小时适用。

实验结果

研究问题

  • RQ1在软最大参数化下,熵正则化是否能诱导CMDPs拉格朗日对偶函数的平滑性?
  • RQ2对于熵正则化CMDPs,对偶下降方法可实现何种收敛速率?
  • RQ3熵正则化是否存在能实现比标准CMDP方法更快收敛的潜力?
  • RQ4能否利用熵正则化项界定对偶间隙,其对标准CMDP近似的影响如何?
  • RQ5对于单约束CMDPs,基于二分法的对偶方法是否可实现线性收敛速率?

主要发现

  • 在Slater条件和探索性初始分布下,拉格朗日对偶函数是平滑的,从而支持加速优化。
  • 对偶最优性差距中 $\mathcal{O}(\varepsilon)$ 的误差,会导致原始最优性差距和约束违反度中 $\mathcal{O}(\sqrt{\varepsilon})$ 的误差。
  • 所提出的加速对偶下降方法在最优性差距和约束违反度上均实现了全局收敛速率 $\widetilde{\mathcal{O}}(1/T)$。
  • 对于单约束CMDPs,基于二分法的对偶方法可实现线性收敛速率。
  • 对偶间隙上界为 $\tau \log|\mathcal{A}| / (1 - \gamma)$,表明当 $\tau$ 较小时,对偶间隙较小,且对标准CMDP的近似效果良好。
  • 熵正则化解可作为求解原始CMDP的热启动,尤其当 $\tau = \mathcal{O}(\epsilon)$ 时。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。