Skip to main content
QUICK REVIEW

[论文解读] Qgraph-bounded Q-learning: Stabilizing Model-Free Off-Policy Deep Reinforcement Learning

Sabrina Hoppe, Marc Toussaint|arXiv (Cornell University)|Jul 15, 2020
Reinforcement Learning in Robotics被引用 5
一句话总结

本文提出Qgraph-bounded Q-learning,一种通过从经验回放缓冲区转移构建子图(Q图)来计算精确、下界Q值的模型无关离策略深度强化学习稳定方法。通过在时序差分学习中强制执行这些边界,该方法可防止软发散,提升样本效率,并增强在连续控制任务中对超参数和有限经验回放缓冲区容量的鲁棒性。

ABSTRACT

In state of the art model-free off-policy deep reinforcement learning, a replay memory is used to store past experience and derive all network updates. Even if both state and action spaces are continuous, the replay memory only holds a finite number of transitions. We represent these transitions in a data graph and link its structure to soft divergence. By selecting a subgraph with a favorable structure, we construct a simplified Markov Decision Process for which exact Q-values can be computed efficiently as more data comes in. The subgraph and its associated Q-values can be represented as a QGraph. We show that the Q-value for each transition in the simplified MDP is a lower bound of the Q-value for the same transition in the original continuous Q-learning problem. By using these lower bounds in temporal difference learning, our method QG-DDPG is less prone to soft divergence and exhibits increased sample efficiency while being more robust to hyperparameters. QGraphs also retain information from transitions that have already been overwritten in the replay memory, which can decrease the algorithm's sensitivity to the replay memory capacity.

研究动机与目标

  • 为解决模型无关离策略深度强化学习中的软发散问题,特别是在连续控制任务中。
  • 分析导致不稳定和发散的回放缓冲区结构特性。
  • 开发一种利用子图结构计算精确、保守Q值边界的方法,以提升学习稳定性。
  • 通过保留被覆盖转移的信息,降低对回放缓冲区容量的敏感性。
  • 提升基于DDPG算法的样本效率和对超参数选择的鲁棒性。

提出的方法

  • 将回放缓冲区表示为数据图,其中节点为状态,边为(状态,动作,奖励,下一状态)转移。
  • 构建Q图作为子图,排除‘悬空末端’(无后继的非终止状态),并通过引入零动作整合此类状态。
  • 使用Q-迭代为Q图计算精确Q值,形成具有原始Q值下界证明的有限MDP。
  • 将这些下界用作时序差分学习中的目标,以稳定Q-learning更新并防止软发散。
  • 通过在策略网络和价值网络更新中修改TD目标,将Q图集成到DDPG中,以纳入下界Q值。
  • 通过假设回报偏差有界,经验性地处理非确定性转移,即使在不确定性下仍保持性能。

实验结果

研究问题

  • RQ1回放缓冲区数据图中的哪些结构模式与离策略深度强化学习中的软发散相关?
  • RQ2能否构建一个经验转移的子图,使得能高效计算精确Q值,并将其用作完整MDP的下界?
  • RQ3在TD学习中强制执行这些下界Q值是否能减少软发散,并提升连续控制任务中的训练稳定性?
  • RQ4Q图在多大程度上提升了样本效率和对超参数设置的鲁棒性?
  • RQ5Q图能否保留已被覆盖在回放缓冲区中的转移的有用信息?

主要发现

  • Q图方法QG-DDPG通过利用回放缓冲区转移的子图推导出的保守Q值边界,在连续控制任务中有效防止了软发散。
  • QG-DDPG在样本效率上优于原始DDPG,尤其在不利的超参数设置下表现更优。
  • 即使回放缓冲区中仅有1,000次转移,QG-DDPG的性能仍与使用无限内存的原始DDPG相当,展现出对内存容量限制的强鲁棒性。
  • 该方法在转移非确定性增加时仍保持有效,表现出对理论中确定性假设的鲁棒性。
  • Q图隐式保留了被覆盖转移的信息,降低了对回放缓冲区大小的敏感性。
  • Q图提供的下界比一般边界更具信息量,因为它们能纠正当前策略下更可能访问状态的低估问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。