Skip to main content
QUICK REVIEW

[论文解读] Stochastic Recursive Momentum for Policy Gradient Methods

Huizhuo Yuan, Xiangru Lian|arXiv (Cornell University)|Mar 9, 2020
Stochastic Gradient Optimization Techniques参考文献 25被引用 14
一句话总结

本文提出 STORM-PG,一种新颖的策略梯度方法,通过利用随机递归动量实现方差减少,且无需批次交替。其样本复杂度达到最优的 $O(1/ heta^3)$,与现有最佳已知收敛速率一致,同时实现了更简单的超参数调优和优于现有方差减少基线方法的实验性能。

ABSTRACT

In this paper, we propose a novel algorithm named STOchastic Recursive Momentum for Policy Gradient (STORM-PG), which operates a SARAH-type stochastic recursive variance-reduced policy gradient in an exponential moving average fashion. STORM-PG enjoys a provably sharp $O(1/ε^3)$ sample complexity bound for STORM-PG, matching the best-known convergence rate for policy gradient algorithm. In the mean time, STORM-PG avoids the alternations between large batches and small batches which persists in comparable variance-reduced policy gradient methods, allowing considerably simpler parameter tuning. Numerical experiments depicts the superiority of our algorithm over comparative policy gradient algorithms.

研究动机与目标

  • 为解决由于分布偏移和噪声梯度导致的策略梯度方法中高样本复杂度与方差问题。
  • 消除方差减少型策略梯度方法中对大批次与小批次交替使用的依赖,以简化超参数调优。
  • 开发一种稳定且高效的策略梯度算法,在训练过程中始终保持低方差,无需重启机制。
  • 在非凸随机优化设置下,实现强化学习领域的最先进收敛速率。

提出的方法

  • STORM-PG 将 STORM 方差减少框架整合进策略梯度方法,利用指数移动平均递归估计并减少梯度方差。
  • 它用连续的、基于动量的方差稳定机制替代 SVRPG 和 SRVRPG 等方法中传统的批次重启机制。
  • 该算法通过过去梯度的加权平均递归估计梯度,其衰减由动量因子控制。
  • 通过 Adam 优化器结合学习率衰减实现自适应学习率,降低对初始学习率选择的敏感性。
  • 该方法使用固定的迷你批次大小 $B$ 和初始大批次大小 $S_0$,避免了对内层循环迭代次数的调优。
  • 采用具有单隐藏层的高斯策略,通过多次独立运行的平均回报来评估性能。

实验结果

研究问题

  • RQ1是否能够设计一种方差减少型策略梯度方法,在不依赖批次交替的前提下实现最优的 $O(1/\epsilon^3)$ 收敛?
  • RQ2用指数移动平均替代重启机制是否能提升训练稳定性并降低超参数敏感性?
  • RQ3STORM-PG 是否能在收敛速度和最终性能上优于现有方差减少基线方法(如 SVRPG 和 SRVRPG)?
  • RQ4所提方法在缺乏内层循环调优的情况下,对超参数选择是否具有鲁棒性?

主要发现

  • STORM-PG 实现了 $O(1/\epsilon^3)$ 的样本复杂度界,与策略梯度方法中已知的最佳理论收敛速率一致。
  • 在 Cart-Pole 环境中,STORM-PG 约在 500 条轨迹后达到最优性能,优于 SRVRPG 和 SVRPG,后者需约 1500 条轨迹。
  • 在 Mountain-Car 任务中,STORM-PG 在 600 条轨迹内即实现稳定且优异的性能,而基线方法需超过 1000 条轨迹才能达到相近结果。
  • STORM-PG 展现出显著降低的超参数敏感性,因其无需调优迷你批次大小 $B$ 或内层循环迭代次数,而 SVRPG 和 SRVRPG 则需要。
  • 该算法在各类环境中均表现出更优的训练稳定性与更快的收敛速度,重复运行中平均回报更高,置信区间更紧密。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。