Skip to main content
QUICK REVIEW

[论文解读] Zeroth-order Deterministic Policy Gradient

Harshat Kumar, Dionysios S. Kalogerias|arXiv (Cornell University)|Jun 12, 2020
Reinforcement Learning in Robotics参考文献 36被引用 5
一句话总结

该论文提出零阶确定性策略梯度(ZDPG),一种无需价值函数评论者(critic)的模型无关强化学习算法。该方法通过低维动作空间扰动对Q函数进行两点零阶查询,以估计策略梯度,从而消除对评论者的依赖。ZDPG实现了可证明的算法稳定性,并将有限样本复杂度最多降低两个数量级,在系统噪声环境下的导航任务中优于标准策略梯度(PG)和基线PG方法。

ABSTRACT

Deterministic Policy Gradient (DPG) removes a level of randomness from standard randomized-action Policy Gradient (PG), and demonstrates substantial empirical success for tackling complex dynamic problems involving Markov decision processes. At the same time, though, DPG loses its ability to learn in a model-free (i.e., actor-only) fashion, frequently necessitating the use of critics in order to obtain consistent estimates of the associated policy-reward gradient. In this work, we introduce Zeroth-order Deterministic Policy Gradient (ZDPG), which approximates policy-reward gradients via two-point stochastic evaluations of the $Q$-function, constructed by properly designed low-dimensional action-space perturbations. Exploiting the idea of random horizon rollouts for obtaining unbiased estimates of the $Q$-function, ZDPG lifts the dependence on critics and restores true model-free policy learning, while enjoying built-in and provable algorithmic stability. Additionally, we present new finite sample complexity bounds for ZDPG, which improve upon existing results by up to two orders of magnitude. Our findings are supported by several numerical experiments, which showcase the effectiveness of ZDPG in a practical setting, and its advantages over both PG and Baseline PG.

研究动机与目标

  • 通过消除对评论者的依赖,恢复确定性策略梯度方法中真正的模型无关策略学习。
  • 通过提出一种可证明稳定的零阶梯度估计框架,解决标准策略梯度方法中的不稳定性和高方差问题。
  • 通过减少对高维扰动和评论者偏差的依赖,提升强化学习中的有限样本收敛速率。
  • 通过在低维动作空间中进行扰动,实现在高维策略空间中的高效且可扩展的策略优化。
  • 在具有最小蒙特卡洛方差减少的噪声环境和实际场景中,展示对标准PG和基线PG方法的鲁棒性和优越性。

提出的方法

  • ZDPG通过在初始动作附近的低维动作空间扰动处对Q函数进行随机评估,构建策略-奖励梯度的两点零阶估计。
  • 它利用随机时域滚动(random horizon rollouts)获得Q函数的无偏、噪声估计,从而实现无需评论者的梯度近似。
  • 该方法通过动作扰动引入平滑的代理目标,确保在不使用启发式基线技术的情况下实现准梯度方差稳定性。
  • 该算法每轮次仅使用单个或一批两点Q评估,每更新只需两次系统滚动,显著降低计算开销。
  • 它采用平滑参数μ来控制扰动幅度,平衡梯度近似中的估计精度与方差。
  • 在标准正则性条件(Lipschitz连续的Q函数、Hessian-Lipschitz)下,进行了有限样本收敛性分析,所得复杂度界优于先前的零阶方法。

实验结果

研究问题

  • RQ1确定性策略梯度方法是否能在不依赖价值函数评论者的情况下实现真正的模型无关学习?
  • RQ2在高维策略空间中,如何实现高效且稳定的零阶梯度估计,同时最小化扰动维度?
  • RQ3在标准正则性假设下,零阶确定性策略梯度方法的有限样本收敛速率如何?
  • RQ4在系统噪声下,ZDPG与标准PG和基线PG方法在样本效率和鲁棒性方面有何比较?
  • RQ5零阶方法是否能在无需基于评论者的值函数近似的情况下,实现可证明的稳定性与改进的收敛速率?

主要发现

  • 在Q函数满足Grad-Lipschitz和Hessian-Lipschitz假设下,ZDPG相较于现有零阶方法,将有限样本复杂度界最多降低两个数量级。
  • 在系统噪声ω = 0.1的导航任务中,ZDPG-S在未应用蒙特卡洛方差减少(N=1)时仍持续优于PG-B,展现出更强的噪声鲁棒性。
  • ZDPG-S在长评估时域(T=100)下保持稳定的学习曲线,而PG-B表现出不稳定性,包括长时间次优徘徊和无法抵达目标。
  • 即使PG-B使用多轮次估计基线值函数,其性能仍逊于仅需每轮次两次滚动的ZDPG-S,凸显ZDPG在效率和鲁棒性方面的优势。
  • ZDPG中移除随机策略后,学习过程实现更快且更一致的收敛,该结论在多个噪声水平和滚动长度下均通过学习曲线得到验证。
  • 所提方法通过非启发式、基于确定性策略的梯度估计,实现了可证明的方差稳定性,与标准PG中使用的启发式基线技术形成鲜明对比。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。