Skip to main content
QUICK REVIEW

[论文解读] A Hybrid Stochastic Policy Gradient Algorithm for Reinforcement Learning

Nhan H. Pham, Lam M. Nguyen|arXiv (Cornell University)|Mar 1, 2020
Reinforcement Learning in Robotics参考文献 47被引用 6
一句话总结

本文提出了一种新颖的混合随机策略梯度估计器,该估计器结合了无偏的REINFORCE估计器与有偏的SARAH-based估计器,以在保持计算效率的同时降低方差。由此产生的ProxHSPGA算法在复合策略优化中实现了找到一阶平稳点的最优轨迹复杂度𝒪(ε⁻³),在非复合与复合设置下均优于现有方法(如REINFORCE的𝒪(ε⁻⁴)和SVRPG的𝒪(ε⁻¹⁰ᐟ³))。

ABSTRACT

We propose a novel hybrid stochastic policy gradient estimator by combining an unbiased policy gradient estimator, the REINFORCE estimator, with another biased one, an adapted SARAH estimator for policy optimization. The hybrid policy gradient estimator is shown to be biased, but has variance reduced property. Using this estimator, we develop a new Proximal Hybrid Stochastic Policy Gradient Algorithm (ProxHSPGA) to solve a composite policy optimization problem that allows us to handle constraints or regularizers on the policy parameters. We first propose a single-looped algorithm then introduce a more practical restarting variant. We prove that both algorithms can achieve the best-known trajectory complexity $\mathcal{O}\left(\varepsilon^{-3} ight)$ to attain a first-order stationary point for the composite problem which is better than existing REINFORCE/GPOMDP $\mathcal{O}\left(\varepsilon^{-4} ight)$ and SVRPG $\mathcal{O}\left(\varepsilon^{-10/3} ight)$ in the non-composite setting. We evaluate the performance of our algorithm on several well-known examples in reinforcement learning. Numerical results show that our algorithm outperforms two existing methods on these examples. Moreover, the composite settings indeed have some advantages compared to the non-composite ones on certain problems.

研究动机与目标

  • 为解决强化学习中策略梯度方法在大规模或连续动作空间下的高方差问题。
  • 开发一种方差减少的策略梯度估计器,结合无偏(REINFORCE)与有偏(SARAH)估计器的优势。
  • 设计一种近端算法,以处理具有正则化或策略参数约束的复合目标。
  • 与现有策略梯度方法相比,实现更高的样本效率和更快的收敛速率。
  • 在连续控制任务中,通过实验验证正则化在复合设置下的优越性。

提出的方法

  • 通过结合无偏的REINFORCE估计器与改进的SARAH估计器(有偏),提出一种混合策略梯度估计器,得到一个有偏但方差更低的估计器。
  • 为具有正则化或约束的复合策略优化,开发一种单循环近端混合随机策略梯度算法(ProxHSPGA)。
  • 提出ProxHSPGA的重启变体,以提升实际收敛性与稳定性。
  • 通过引入带有正则化项Q(θ)的近端步骤,处理复合目标,确保算法的稳定性和收敛性。
  • 采用小批量与快照策略以降低梯度方差,并在非独立同分布采样条件下进行收敛性理论分析。
  • 采用受SVRG和SARAH启发的方差减少机制,并将其适配至基于轨迹采样的策略梯度设置。

实验结果

研究问题

  • RQ1结合无偏与有偏估计器的混合策略梯度估计器,是否能实现比现有方法更优的方差减少效果?
  • RQ2所提出的ProxHSPGA算法在复合策略优化中,是否实现了比REINFORCE、GPOMDP和SVRPG更优的轨迹复杂度?
  • RQ3在策略优化问题中引入正则化或约束,是否能提升连续控制任务中的样本效率与性能表现?
  • RQ4ProxHSPGA的重启变体与单循环版本相比,在收敛速度与稳定性方面表现如何?
  • RQ5在MuJoCo环境中,不同正则化项对最终策略性能有何影响?

主要发现

  • ProxHSPGA算法实现𝒪(ε⁻³)的轨迹复杂度以达到一阶平稳点,这是复合策略优化问题中目前已知的最佳速率。
  • 混合估计器相比REINFORCE显著降低了方差,同时保持了计算效率,从而在实践中实现更快收敛。
  • 数值实验表明,ProxHSPGA在标准控制基准测试(包括CartPole、Acrobot和MuJoCo环境)中均优于GPOMDP与SVRPG。
  • 包含正则化的复合设置始终优于非复合设置,表明正则化能提升样本效率与策略稳定性。
  • ProxHSPGA的重启变体在高维与连续控制任务中表现出更优的实际收敛性能。
  • 该算法在𝒪(ε⁻³)内保持了轨迹总数与近端操作次数,证实了其理论效率与可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。