[论文解读] Policy Optimization for Continuous Reinforcement Learning
该论文提出了一种基于随机微分方程的连续时间策略优化框架,用于强化学习,引入了一种针对折扣目标的新颖占用时间度量。推导了性能差异和局部近似公式,实现了无需时间/空间离散化的策略梯度与TRPO/PPO方法的连续版本,并通过实验验证了其收敛性及对离散基线方法的优越性。
We study reinforcement learning (RL) in the setting of continuous time and space, for an infinite horizon with a discounted objective and the underlying dynamics driven by a stochastic differential equation. Built upon recent advances in the continuous approach to RL, we develop a notion of occupation time (specifically for a discounted objective), and show how it can be effectively used to derive performance-difference and local-approximation formulas. We further extend these results to illustrate their applications in the PG (policy gradient) and TRPO/PPO (trust region policy optimization/ proximal policy optimization) methods, which have been familiar and powerful tools in the discrete RL setting but under-developed in continuous RL. Through numerical experiments, we demonstrate the effectiveness and advantages of our approach.
研究动机与目标
- 为折扣目标下的连续时间随机控制问题建立离散MDP中访问频率(占用时间)的连续时间对应形式。
- 通过扰动分析推导连续时间强化学习中的性能差异与局部近似公式。
- 在无需预先进行时间或空间离散化的情况下,开发策略梯度(PG)、TRPO与PPO方法的连续时间版本。
- 在连续随机控制任务中,验证所提方法的收敛性与性能优越性。
提出的方法
- 提出一种专为连续时间随机控制中折扣目标设计的新占用时间概念。
- 通过扰动分析推导性能差异公式,建立策略变化与性能变化之间的联系。
- 基于性能度量的局部近似公式,推导出具有可证明有界性的近似,从而支持最小化-最大化(MM)算法设计。
- 通过将离散方法适配至连续动态,利用所推导公式提出连续时间PG、TRPO与PPO变体。
- 采用神经网络参数化策略函数与价值函数,基于采样轨迹进行梯度更新。
- 在CPPO中采用平方根与线性KL散度控制策略更新,消融实验表明平方根变体收敛性更优。

实验结果
研究问题
- RQ1在具有折扣目标的离散MDP中,访问频率(占用时间)的连续时间对应形式是什么?
- RQ2能否在连续时间强化学习中推导出类似于离散MDP中的性能差异公式?
- RQ3如何将信任区域与近端策略优化方法适配至连续时间、连续状态的强化学习?
- RQ4所提出的连续时间策略优化方法是否在收敛性与稳定性方面优于其离散时间对应方法?
主要发现
- 在随机控制任务的数值实验中,所提出的连续时间策略梯度(CPG)与CPPO方法收敛至最优策略。
- 采用平方根KL散度的CPPO优于线性KL版本,可避免陷入局部最优,并表现出更稳定的收敛性。
- CPG与CPPO在性能上可与或优于离散时间PG与PPO方法,即使在粗粒度时间离散化(δt = 0.1)下亦成立,表明连续形式可能具有潜在优势。
- 连续框架支持无需显式时间或空间离散化的策略优化,完整保留了底层SDE动态的连续性。
- 性能差异公式可准确估计策略改进,验证了该方法的理论基础。
- 该方法对时间离散化具有鲁棒性,实验表明在不同δt值下性能保持一致。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。