[论文解读] Stochastic Variance-Reduced Policy Gradient
本文提出SVRPG,一种用于强化学习的随机方差缩减策略梯度算法,可解决非凹目标、全梯度近似和MDP中的非平稳采样问题。通过利用重要性权重保持梯度无偏性,SVRPG在批量大小增加时实现线性收敛,展示了在连续控制任务中更高的样本效率和稳定性。
In this paper, we propose a novel reinforcement- learning algorithm consisting in a stochastic variance-reduced version of policy gradient for solving Markov Decision Processes (MDPs). Stochastic variance-reduced gradient (SVRG) methods have proven to be very successful in supervised learning. However, their adaptation to policy gradient is not straightforward and needs to account for I) a non-concave objective func- tion; II) approximations in the full gradient com- putation; and III) a non-stationary sampling pro- cess. The result is SVRPG, a stochastic variance- reduced policy gradient algorithm that leverages on importance weights to preserve the unbiased- ness of the gradient estimate. Under standard as- sumptions on the MDP, we provide convergence guarantees for SVRPG with a convergence rate that is linear under increasing batch sizes. Finally, we suggest practical variants of SVRPG, and we empirically evaluate them on continuous MDPs.
研究动机与目标
- 开发一种适用于强化学习的方差缩减策略梯度方法,其中标准SVRG技术因非凹目标函数和非平稳数据分布而面临挑战。
- 解决将SVRG应用于策略梯度的三个关键难点:非凹目标函数、全梯度计算中的近似以及非平稳采样过程。
- 在存在重要性加权的情况下保持梯度估计的无偏性,同时在标准MDP假设下确保收敛性。
- 在批量大小增加的条件下,提供理论收敛保证,实现线性收敛速率,优于标准随机策略梯度方法。
- 在连续控制基准上实证验证该方法,结果表明其在样本效率和稳定性方面优于基线策略梯度方法。
提出的方法
- 提出SVRPG,一种新颖的策略梯度算法,将SVRG框架与策略梯度相结合,使用两个独立的ADAM优化器:一个用于快照更新,另一个用于子迭代。
- 采用重要性加权以校正当前策略与快照策略之间的分布偏移,保持梯度估计的无偏性。
- 采用双层优化循环:外层在快照策略处计算全梯度估计,内层使用带有方差缩减的迷你批次执行多次随机更新。
- 为快照阶段和子迭代阶段分别设置学习率和自适应动量历史,其中快照ADAM使用更大的批量大小(N)和更高的学习率。
- 提出一种实用变体,在Half Cheetah任务中使用线性基线(评论家)进行方差缩减,通过最小二乘法在每个快照点进行拟合。
- 采用期望策略梯度的有限和近似,其中全梯度通过大量轨迹的批量估计,而随机梯度通过迷你批次计算。
实验结果
研究问题
- RQ1尽管存在非凹目标函数和非平稳采样,方差缩减梯度方法(如SVRG)能否成功适配到策略梯度强化学习?
- RQ2在使用重要性加权和近似全梯度时,如何在策略梯度中保持梯度估计的无偏性?
- RQ3在标准MDP假设下,方差缩减策略梯度算法的理论收敛速率是多少?
- RQ4在连续控制任务中,SVRPG相较于标准策略梯度基线在样本效率和稳定性方面表现如何?
- RQ5在真实强化学习环境中,元超参数和自适应优化器的最佳实际配置是什么?
主要发现
- 在标准MDP假设下,SVRPG实现O(1/T)的线性收敛速率,且随着批量大小增加,收敛性进一步提升。
- 该算法在Half Cheetah、Swimmer和Cart-Pole等连续控制任务中表现出更优的样本效率和稳定性,优于标准策略梯度基线。
- 实证结果表明,为快照和子迭代阶段分别使用独立的ADAM优化器,显著提升了训练稳定性和收敛速度。
- 在Half Cheetah中引入线性基线可降低方差并加速学习,且评论家仅在快照点处更新。
- SVRPG在不同环境中保持一致的性能表现,且超参数调优需求极少,尤其在使用重要性加权校正分布偏移时效果显著。
- 该方法在Mujoco基准测试中表现强劲,智能体成功学习在复杂、高维状态-动作空间中保持平衡并向前移动。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。