Skip to main content
QUICK REVIEW

[论文解读] Policy Gradient Methods for Off-policy Control

Lucas Lehnert, Doina Precup|arXiv (Cornell University)|Dec 13, 2015
Reinforcement Learning in Robotics参考文献 6被引用 5
一句话总结

本文提出了一种新型基于梯度的离策略强化学习算法——策略梯度Q-learning(PGQ),该算法将策略梯度整合进GQ框架,以纠正由自适应行为策略引起的分布漂移问题。通过将平稳分布建模为策略参数的函数,PGQ在控制任务中实现收敛,同时改进并评估策略,其在离策略设置(如Baird反例)中的表现优于Q-learning和GQ。

ABSTRACT

Off-policy learning refers to the problem of learning the value function of a way of behaving, or policy, while following a different policy. Gradient-based off-policy learning algorithms, such as GTD and TDC/GQ, converge even when using function approximation and incremental updates. However, they have been developed for the case of a fixed behavior policy. In control problems, one would like to adapt the behavior policy over time to become more greedy with respect to the existing value function. In this paper, we present the first gradient-based learning algorithms for this problem, which rely on the framework of policy gradient in order to modify the behavior policy. We present derivations of the algorithms, a convergence theorem, and empirical evidence showing that they compare favorably to existing approaches.

研究动机与目标

  • 解决控制任务中缺乏收敛的基于梯度的离策略算法的问题,其中行为策略是非平稳的,导致分布漂移。
  • 通过引入策略梯度校正项,将GQ和TDC等离策略值函数学习方法扩展至控制设置。
  • 通过将平稳分布建模为策略参数的函数,实现在离策略控制中的稳定学习。
  • 为具有函数逼近的基于梯度的离策略控制提供理论收敛保证。
  • 在具有挑战性的离策略环境(如Baird反例)中对方法进行实证验证。

提出的方法

  • 提出一种改进的均方投影贝尔曼误差(MSPBE)目标函数,通过 $d_{s,a} = d_s \pi_\theta(a|s)$ 显式建模平稳分布 $d_{s,a}$ 对策略参数 $\theta$ 的依赖关系。
  • 通过考虑贝尔曼算子和平稳分布对 $\theta$ 的参数化依赖,推导出MSPBE目标函数的梯度,引入策略梯度项。
  • 提出一种新的值函数参数 $\theta$ 的更新规则,其中包含与 $\rho^\nabla \delta (\phi^\top w)$ 成比例的校正项,其中 $\rho^\nabla$ 用于捕捉策略梯度对分布的影响。
  • 采用双时间尺度更新:$\theta$ 使用学习率 $\alpha$ 更新,权重向量 $w$(用于投影贝尔曼误差)使用学习率 $\beta$ 更新,以确保稳定性。
  • 采用Boltzmann策略进行探索,动作选择概率为 $\pi_\theta(a|s) = \exp(\theta^\top \phi(s,a)/\tau)/\sum_b \exp(\theta^\top \phi(s,b)/\tau)$。
  • 使用采样转移或模拟轨迹进行在线策略和离策略更新,以MSPBE和MSTDE作为评估指标。

实验结果

研究问题

  • RQ1基于梯度的离策略算法能否被扩展至具有非平稳行为策略的控制问题,同时保持收敛性?
  • RQ2如何将策略梯度项整合进GQ/TDC框架,以纠正离策略学习中的分布漂移?
  • RQ3所提出的PGQ算法是否能在Baird反例等具有挑战性的离策略环境中收敛至零MSPBE?
  • RQ4在离策略采样条件下,PGQ与Q-learning和GQ相比,在稳定性和收敛速度方面表现如何?
  • RQ5在离策略值函数学习中,策略参数对平稳分布的影响是什么?

主要发现

  • 在Baird反例中,PGQ收敛至零均方投影贝尔曼误差(MSPBE),而Q-learning在相同条件下单调发散。
  • 在采样和轨迹两种实验设置中,PGQ均实现稳定收敛,其性能优于Q-learning,并在收敛速度和精度上与GQ相当。
  • 该算法通过在值函数更新中引入策略梯度校正项,成功缓解了由策略自适应引起的分布漂移。
  • 实证结果表明,PGQ在多次运行中均保持低MSPBE和均方TD误差(MSTDE),表明其具有鲁棒性和稳定性。
  • 该方法在离策略设置下表现出收敛性,即使行为策略与目标策略不同,也使用Boltzmann探索策略。
  • 理论分析证实,梯度推导考虑了平稳分布对 $\theta$ 的参数化依赖,从而实现了控制任务中的稳定学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。