Skip to main content
QUICK REVIEW

[论文解读] Generalized Off-Policy Actor-Critic

Shangtong Zhang, Wendelin Boehmer|arXiv (Cornell University)|Mar 27, 2019
Reinforcement Learning in Robotics参考文献 49被引用 7
一句话总结

本文提出了反事实目标(counterfactual objective),这是一种统一的离策略策略梯度强化学习框架,相较于现有方法能更准确地预测目标策略的性能。通过推导广义离策略策略梯度定理并采用强调方法进行无偏梯度估计,作者提出了Geoff-PAC,这是首个在深度强化学习基准中实现经验成功的强调算法,其在MuJoCo机器人任务上的表现优于以往的离策略演员-critic方法。

ABSTRACT

We propose a new objective, the counterfactual objective, unifying existing objectives for off-policy policy gradient algorithms in the continuing reinforcement learning (RL) setting. Compared to the commonly used excursion objective, which can be misleading about the performance of the target policy when deployed, our new objective better predicts such performance. We prove the Generalized Off-Policy Policy Gradient Theorem to compute the policy gradient of the counterfactual objective and use an emphatic approach to get an unbiased sample from this policy gradient, yielding the Generalized Off-Policy Actor-Critic (Geoff-PAC) algorithm. We demonstrate the merits of Geoff-PAC over existing algorithms in Mujoco robot simulation tasks, the first empirical success of emphatic algorithms in prevailing deep RL benchmarks.

研究动机与目标

  • 为解决离策略强化学习中‘巡游目标’(excursion objective)的误导性问题,该目标衡量的是在行为策略的平稳分布下目标策略的性能,而非目标策略自身分布下的性能。
  • 提出一种新目标——称为反事实目标——通过可控参数 γ̂ 统一巡游目标与替代生活目标(真实部署性能),实现连续插值。
  • 证明广义离策略策略梯度定理(Generalized Off-Policy Policy Gradient Theorem),实现对反事实目标的无偏策略梯度估计。
  • 开发Geoff-PAC,一种基于强调方法的演员-critic算法,可为反事实目标提供无偏样本的策略梯度。
  • 在具有挑战性的深度强化学习环境中实证验证Geoff-PAC,证明其在性能上优于现有离策略算法。

提出的方法

  • 将反事实目标定义为巡游目标(γ̂ = 0)与替代生活目标(γ̂ = 1)之间的连续插值,利用行为策略的平稳分布来评估在目标策略下假设性偏离(excursions)的性能。
  • 推导广义离策略策略梯度定理(GOPPG 定理),通过目标策略与行为策略之间密度比的微分,计算反事实目标的策略梯度。
  • 采用强调方法(Sutton et al., 2016)计算无偏的策略梯度样本,在温和假设下可保证极限收敛。
  • 将Geoff-PAC实现为一种深度强化学习算法,结合反事实目标、函数逼近与离策略时序差分学习。
  • 通过密度比对过渡样本进行重加权,使梯度估计与反事实目标保持一致,避免了以往方法中常见的有偏‘策略半梯度’更新。
  • 引入参数化的 γ̂,实现目标中偏差-方差权衡的灵活性,支持稳健的策略优化。

实验结果

研究问题

  • RQ1能否定义一种统一的目标,使其对目标策略真实部署性能的预测优于常用巡游目标?
  • RQ2如何在保持与离策略学习和函数逼近一致的前提下,计算该新目标的策略梯度?
  • RQ3强调方法能否成功应用于深度离策略演员-critic算法,实现在现代基准中的经验成功?
  • RQ4所提出的具有可调参数 γ̂ 的反事实目标是否能提升连续控制任务中的样本效率与最终性能?
  • RQ5Geoff-PAC是否为强调方法在深度强化学习基准中的首次成功应用,且是否优于现有离策略演员-critic算法?

主要发现

  • 反事实目标成功统一了巡游目标与替代生活目标,当 γ̂ = 1 时可恢复真实部署性能目标。
  • 广义离策略策略梯度定理为反事实目标的策略梯度计算提供了理论严谨的方法,即使在缺乏在线策略数据的情况下也成立。
  • Geoff-PAC在深度强化学习基准中首次实现了强调算法的经验成功,在MuJoCo机器人仿真任务中优于现有离策略演员-critic方法。
  • 与基于巡游目标的方法(如Degris et al., 2012 和 Imani et al., 2018)相比,该算法在样本效率和最终性能方面均有提升。
  • γ̂ 的使用实现了灵活的偏差-方差权衡,且方法保持在策略梯度框架内,无需奖励重塑或价值函数重加权。
  • 实证结果表明,Geoff-PAC在多个MuJoCo环境中泛化良好,显示出在复杂控制场景中的鲁棒性与可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。