Skip to main content
QUICK REVIEW

[论文解读] Characterizing the Gap Between Actor-Critic and Policy Gradient

Junfeng Wen, Saurabh Kumar|arXiv (Cornell University)|Jun 13, 2021
Reinforcement Learning in Robotics被引用 5
一句话总结

本文通过量化由于批评者估计偏差导致的策略改进更新差异,填补了演员-评论者(AC)与策略梯度(PG)方法之间的理论空白。提出残差演员-评论者(Res-AC)和斯塔克尔贝格演员-评论者(Stack-AC)框架,分别通过批评者残差或博弈论原理校正AC更新,在表格型和连续控制环境中显著提升了样本效率与最终性能。

ABSTRACT

Actor-critic (AC) methods are ubiquitous in reinforcement learning. Although it is understood that AC methods are closely related to policy gradient (PG), their precise connection has not been fully characterized previously. In this paper, we explain the gap between AC and PG methods by identifying the exact adjustment to the AC objective/gradient that recovers the true policy gradient of the cumulative reward objective (PG). Furthermore, by viewing the AC method as a two-player Stackelberg game between the actor and critic, we show that the Stackelberg policy gradient can be recovered as a special case of our more general analysis. Based on these results, we develop practical algorithms, Residual Actor-Critic and Stackelberg Actor-Critic, for estimating the correction between AC and PG and use these to modify the standard AC algorithm. Experiments on popular tabular and continuous environments show the proposed corrections can improve both the sample efficiency and final performance of existing AC methods.

研究动机与目标

  • 精确刻画使用非线性函数逼近器时,演员-评论者(AC)与策略梯度(PG)方法在目标函数与梯度方面的差异。
  • 识别在使用任意非线性函数逼近器表示评论者时,将AC更新转换为真实PG更新所需的特定校正项。
  • 通过减少由不完美评论者价值估计引入的偏差,提升AC方法对PG方法的逼近精度。
  • 开发实用且可扩展的算法,利用残差估计或博弈论原理校正AC更新。
  • 通过实证验证,上述校正方法可显著提升在表格型与连续控制任务中的样本效率与最终性能。

提出的方法

  • 将AC与PG形式化为两阶段Stackelberg博弈,其中演员与评论者依次行动,评论者负责设定价值估计。
  • 通过分析在评论者价值估计下演员目标函数与真实累积奖励目标函数之间的差异,推导出AC与PG之间精确的梯度差异。
  • 提出残差演员-评论者(Res-AC),通过学习评论者时序差分残差(预测误差)的价值函数,来估计策略梯度的校正项。
  • 引入斯塔克尔贝格演员-评论者(Stack-AC),将AC过程建模为Stackelberg博弈,证明在特定条件下,演员更新会收敛至真实PG。
  • 将Res-AC与Stack-AC的校正机制应用于软演员-评论者(SAC),实现与标准AC方法的直接对比。
  • 采用矩阵-向量记法简化推导过程,并清晰阐明策略改进、价值函数逼近与梯度更新之间的关系。

实验结果

研究问题

  • RQ1当使用非线性函数逼近器表示评论者时,演员-评论者与策略梯度方法之间的精确理论差距是什么?
  • RQ2在目标函数与梯度层面,如何量化AC与PG之间策略改进更新的差异?
  • RQ3是否可以利用评论者价值估计的残差(时序差分误差)来校正由不完美评论者引入的偏差?
  • RQ4在特定条件下,AC的Stackelberg博弈表述是否等价于真实策略梯度?
  • RQ5所提出的校正方法是否能在表格型与连续控制环境中显著提升样本效率与最终性能?

主要发现

  • AC与PG之间的差距源于AC使用评论者提供的状态-动作值估计,而这些估计可能存在偏差且未完全收敛,从而导致次优策略更新。
  • AC策略更新与真实PG更新之间的差异,可形式化为评论者残差(时序差分误差)的函数,该函数量化了价值估计中的偏差。
  • Res-AC通过学习评论者残差的价值函数,成功恢复了真实策略梯度,在表格型与连续控制任务中均显著提升了样本效率与最终性能。
  • Stack-AC基于Stackelberg博弈论视角推导,同样在弱假设下恢复了真实策略梯度,提供了第二种理论严谨的校正机制。
  • 实证结果表明,将Res-AC与Stack-AC校正应用于软演员-评论者(SAC)后,可在多个基准环境中实现更快的学习速度与更高的最终回报。
  • 所提出的校正方法与现有技术(如GAE、TD3、TRPO)正交,可与之结合以进一步提升性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。