Skip to main content
QUICK REVIEW

[论文解读] Is the Policy Gradient a Gradient?

Chris Nota, Philip S. Thomas|arXiv (Cornell University)|Jun 17, 2019
Reinforcement Learning in Robotics参考文献 29被引用 6
一句话总结

本文证明,大多数策略梯度方法,包括最先进的算法如PPO、SAC和TD3,由于对折扣因子处理不当,实际上并未遵循任何目标函数的梯度。作者表明,这些方法优化的方向并非真正的梯度,导致无法收敛或陷入最差的不动点,并揭示了尽管引用量极高,现有文献中仍广泛存在理论性错误陈述。

ABSTRACT

The policy gradient theorem describes the gradient of the expected discounted return with respect to an agent's policy parameters. However, most policy gradient methods drop the discount factor from the state distribution and therefore do not optimize the discounted objective. What do they optimize instead? This has been an open question for several years, and this lack of theoretical clarity has lead to an abundance of misstatements in the literature. We answer this question by proving that the update direction approximated by most methods is not the gradient of any function. Further, we argue that algorithms that follow this direction are not guaranteed to converge to a "reasonable" fixed point by constructing a counterexample wherein the fixed point is globally pessimal with respect to both the discounted and undiscounted objectives. We motivate this work by surveying the literature and showing that there remains a widespread misunderstanding regarding discounted policy gradient methods, with errors present even in highly-cited papers published at top conferences.

研究动机与目标

  • 解决一个长期存在的开放问题:现代策略梯度方法是否在优化一个有效的目标函数。
  • 揭露文献中广泛存在的理论错误,包括顶级会议中高被引论文中的错误。
  • 证明大多数策略梯度算法所使用的更新方向并非任何函数的梯度。
  • 表明这些算法的不动点对于折扣和非折扣目标函数都可能是全局最差的。
  • 澄清策略梯度方法的理论基础,并纠正强化学习社区中的误解。

提出的方法

  • 从数学上证明,由于对折扣因子处理不当,大多数策略梯度方法中的更新方向并非任何目标函数的梯度。
  • 分析策略梯度定理,指出在状态分布中错误地省略了一个折扣因子实例。
  • 构建一个反例,表明该更新方向的不动点在折扣和非折扣回报目标下均为全局最差。
  • 审查来自stable-baselines库的8种顶级强化学习算法(如PPO、SAC、TD3、A2C/A3C),确认它们均使用了错误的梯度公式。
  • 通过理论分析与实证审查表明,八篇被引用论文中仅有一篇承认了与真实策略梯度的偏离,其余均存在误导性或错误的无偏估计声明。
  • 认为文献中误导性声明的根源在于措辞模糊,例如声称估计器无偏但未明确参考目标函数。

实验结果

研究问题

  • RQ1现代策略梯度方法所使用的更新方向是否为任何目标函数的梯度?
  • RQ2像PPO和SAC这样的最先进策略梯度算法实际上优化的是什么目标(如果有)?
  • RQ3这些算法的不动点是否可能在折扣和非折扣回报方面均为全局最差?
  • RQ4为何广泛被引用的强化学习论文仍持续做出关于其梯度估计器无偏性的错误声明?
  • RQ5在状态分布中对折扣因子的错误处理如何影响策略梯度方法的收敛性和最优性?

主要发现

  • 大多数策略梯度方法,包括PPO、SAC、TD3和A2C/A3C,由于状态分布公式错误,实际上并未遵循任何目标函数的梯度。
  • 这些算法所使用的更新方向并非任何函数的梯度,从而否定了其收敛至最优策略的声称。
  • 构建了一个反例,表明该算法的不动点在折扣和非折扣回报目标下均为全局最差。
  • 在所审查的八篇高被引强化学习论文中,仅有一篇承认了与真实策略梯度的偏离,其余均存在误导性或错误的无偏估计声明。
  • 混淆源于文献中措辞模糊,例如声称‘无偏’估计器但未说明参考目标函数,导致广泛误解。
  • 该分析揭示了众多最先进深度强化学习算法设计中存在根本性的理论缺陷,动摇了其理论依据。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。