Skip to main content
QUICK REVIEW

[论文解读] GRAC: Self-Guided and Self-Regularized Actor-Critic

Lin Shao, Yifan You|arXiv (Cornell University)|Sep 18, 2020
Reinforcement Learning in Robotics参考文献 27被引用 6
一句话总结

GRAC 是一种新型的演员-评论家强化学习算法,通过引入自正则化的时序差分学习和结合策略梯度与零阶优化(交叉熵法)的自引导策略改进,消除了对目标网络的需求。它在 OpenAI Gym 套件中的全部六个连续控制任务上实现了最先进性能,学习速度更快、更稳定,优于或匹配先前方法。

ABSTRACT

Deep reinforcement learning (DRL) algorithms have successfully been demonstrated on a range of challenging decision making and control tasks. One dominant component of recent deep reinforcement learning algorithms is the target network which mitigates the divergence when learning the Q function. However, target networks can slow down the learning process due to delayed function updates. Our main contribution in this work is a self-regularized TD-learning method to address divergence without requiring a target network. Additionally, we propose a self-guided policy improvement method by combining policy-gradient with zero-order optimization to search for actions associated with higher Q-values in a broad neighborhood. This makes learning more robust to local noise in the Q function approximation and guides the updates of our actor network. Taken together, these components define GRAC, a novel self-guided and self-regularized actor critic algorithm. We evaluate GRAC on the suite of OpenAI gym tasks, achieving or outperforming state of the art in every environment tested.

研究动机与目标

  • 解决深度 Q-learning 中因依赖目标网络而导致的学习速度下降问题,避免使用目标网络。
  • 通过将策略梯度与零阶优化结合以搜索动作空间,提升策略学习的稳定性和样本效率。
  • 通过最大-最小双 Q-learning 减少 Q-network 之间的过估计和偏差。
  • 开发一种自正则化的时序差分学习方法,在无需延迟目标网络更新的情况下稳定 Q 值更新。
  • 在连续控制环境中实现最先进性能,具备鲁棒性、稳定性与快速学习能力。

提出的方法

  • 在时序差分学习中引入自正则化项,同时最小化目标值的变化和时序差分误差,从而替代目标网络。
  • 采用两阶段策略改进:首先,策略网络输出初始动作;其次,交叉熵法(CEM)在动作邻域内搜索具有更高 Q 值的动作。
  • 使用最大-最小双 Q-learning,其中目标值由两个 Q-network 输出的最小值计算得出,减少过估计并稳定训练过程。
  • 在演员更新中结合两种损失函数:QLoss(策略梯度)和 CEMLoss(通过零阶优化进行动作搜索),实现鲁棒的策略更新。
  • 对评论家采用 Polyak 平均进行软更新,但自正则化使得即使没有目标网络也能实现稳定训练。
  • 采用双 Q-network 架构并结合最大-最小双 Q-learning,以平衡 Q-function 的大小并减少发散。

实验结果

研究问题

  • RQ1是否可以在不使用目标网络的情况下稳定深度 Q-learning,从而加速学习?
  • RQ2零阶优化方法(如 CEM)是否能通过在当前策略输出的邻域内探索高回报动作,改善策略学习?
  • RQ3与裁剪双 Q-learning 相比,最大-最小双 Q-learning 是否更有效地减少过估计和 Q-network 之间的偏差?
  • RQ4自正则化的时序差分学习是否能在实现更快函数更新的同时保持稳定的 Q 值估计?
  • RQ5将策略梯度与零阶优化结合,是否能在连续控制任务中带来更优越的性能?

主要发现

  • GRAC 在 OpenAI Gym 套件中的全部六个连续控制任务(包括 Ant-v2、Humanoid-v2 和 HalfCheetah-v2)上实现了或超越了最先进性能。
  • GRAC 采用自正则化且无需目标网络,其性能与 DDPG 相当或更优,同时学习速度更快且避免了发散。
  • 消融实验表明,同时使用 QLoss 和 CEMLoss 的性能优于单独使用任一损失,其中 CEMLoss 在 Swimmer 上尤为有效,而 QLoss 在 HalfCheetah 上表现更佳。
  • 将最大-最小双 Q-learning 替换为裁剪双 Q-learning 导致 Q 值学习不稳定,Q1 相对于 Q2 显著爆炸,引发性能崩溃。
  • GRAC w/o CriticCEM(使用裁剪双 Q-learning)表现出高方差和不稳定的 Q 值更新,而 GRAC 保持了平滑的 Q-function 增长和较低的 Q1−Q2 差异。
  • GRAC w/o CriticCEM w/ minQUpdate(使用 Q-network 最小值)在 Ant-v2 和 Humanoid-v2 等高难度任务上表现不如 GRAC,表明最大-最小双 Q-learning 更为有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。