[论文解读] An Off-policy Policy Gradient Theorem Using Emphatic Weightings
本文提出了首个使用强调权重的离策略策略梯度定理,实现了对一般策略参数化的精确梯度估计。所提出的ACE算法在先前方法如OffPAC和DPG失败的反例中收敛至最优策略,证明了在离策略学习中精确梯度更新相较于半梯度近似方法的必要性。
Policy gradient methods are widely used for control in reinforcement learning, particularly for the continuous action setting. There have been a host of theoretically sound algorithms proposed for the on-policy setting, due to the existence of the policy gradient theorem which provides a simplified form for the gradient. In off-policy learning, however, where the behaviour policy is not necessarily attempting to learn and follow the optimal policy for the given task, the existence of such a theorem has been elusive. In this work, we solve this open problem by providing the first off-policy policy gradient theorem. The key to the derivation is the use of $emphatic$ $weightings$. We develop a new actor-critic algorithm$\unicode{x2014}$called Actor Critic with Emphatic weightings (ACE)$\unicode{x2014}$that approximates the simplified gradients provided by the theorem. We demonstrate in a simple counterexample that previous off-policy policy gradient methods$\unicode{x2014}$particularly OffPAC and DPG$\unicode{x2014}$converge to the wrong solution whereas ACE finds the optimal solution.
研究动机与目标
- 解决长期存在的开放问题:为一般策略参数化(超越表格化设置)推导出理论上可靠的离策略策略梯度定理。
- 解决现有离策略策略梯度方法(如OffPAC和DPG)的局限性,这些方法依赖半梯度近似,可能导致收敛至次优解。
- 开发一种新的演员-评论家算法ACE,通过引入强调权重来纠正离策略分布偏移,从而遵循真实梯度进行更新。
- 通过反例证明,半梯度方法无法达到最优策略,而ACE能够实现收敛。
- 研究在表格化与连续动作设置下,估计值与真实值强调权重对学习性能的影响。
提出的方法
- 推导出一种新颖的离策略策略梯度定理,利用强调权重简化梯度,以纠正行为策略与目标策略之间的差异。
- 提出演员-评论家强调权重算法(ACE),利用推导出的定理计算策略更新的精确梯度。
- 采用Yu(2015)和Sutton等人(2016)提出的技术,对强调权重进行增量估计,实现在未知环境中的在线学习。
- 将该定理应用于随机策略与确定性策略,证明其在不同策略类型下的通用性。
- 使用评论家估计状态值,另设演员基于强调加权梯度更新策略参数。
- 利用重要性采样比率与强调权重纠正离策略数据分布,确保梯度估计无偏。
实验结果
研究问题
- RQ1能否为一般策略参数化(超越表格化设置)推导出理论上可靠的离策略策略梯度定理?
- RQ2现有离策略策略梯度方法(如OffPAC和DPG)是否因依赖半梯度近似而收敛至次优解?
- RQ3强调权重的使用能否实现在离策略学习中的精确梯度估计,从而实现收敛至最优策略?
- RQ4估计的强调权重的准确性如何影响ACE算法在长轨迹与连续动作空间中的性能?
- RQ5在离策略演员-评论家学习中,遵循真实梯度是否相较于半梯度更新具有根本性优势?
主要发现
- 在一个存在状态别名的三状态反例中,OffPAC与DPG收敛至次优策略,而ACE收敛至最优解,证明了半梯度方法的失效。
- 使用精确强调权重的True-ACE在11状态MDP中实现最优性能,而使用估计权重的ACE在λa增大时性能下降,表明估计误差影响学习效果。
- 在连续动作MDP中,DPG因更新偏差而倾向于正向动作,收敛至次优策略;而True-DPGE与True-ACE正确学习到负向动作偏好。
- ACE在λa = 1时显著优于λa = 0,但仍逊于True-ACE,表明估计强调权重在复杂环境中会降低性能。
- 结果表明,当前强调权重的估计方法在连续动作空间中仍显不足,更精确的估计对扩展ACE至此类设置至关重要。
- 本研究证实,如OffPAC与DPG等半梯度方法在离策略设置中本质上存在缺陷,因为其不动点不包含最优策略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。