Skip to main content
QUICK REVIEW

[论文解读] Deep Residual Reinforcement Learning

Shangtong Zhang, Wendelin Boehmer|arXiv (Cornell University)|May 3, 2019
Reinforcement Learning in Robotics参考文献 51被引用 7
一句话总结

本文提出了一种双向目标网络技术,以稳定残差强化学习(RL)算法,在无模型和有模型的RL中均显著提升性能。结果表明,残差算法在DeepMind Control Suite中优于原始DDPG算法,并且在有模型规划中比TD(k)更有效地解决了分布不匹配问题,仅需1步 rollout 而非k步假设。

ABSTRACT

We revisit residual algorithms in both model-free and model-based reinforcement learning settings. We propose the bidirectional target network technique to stabilize residual algorithms, yielding a residual version of DDPG that significantly outperforms vanilla DDPG in the DeepMind Control Suite benchmark. Moreover, we find the residual algorithm an effective approach to the distribution mismatch problem in model-based planning. Compared with the existing TD($k$) method, our residual-based method makes weaker assumptions about the model and yields a greater performance boost.

研究动机与目标

  • 解决半梯度深度RL算法中的不稳定性和缺乏理论保证的问题。
  • 通过引入一种新颖的双向目标网络技术,稳定深度RL中的残差算法。
  • 证明残差算法在缓解有模型规划中分布不匹配问题方面的有效性。
  • 提供实证证据表明,残差算法在有模型规划中优于TD(k)等现有方法。

提出的方法

  • 提出一种双向目标网络技术,通过同时维护价值和残差梯度的目标网络,稳定残差学习。
  • 将残差算法集成到DDPG中,构建出残差版本(Bi-Res-DDPG),提升了样本效率和性能。
  • 使用混合系数η组合半梯度和残差梯度更新,实现在非线性函数逼近下的稳定训练。
  • 通过使用1步 rollout 在真实和虚拟转移上训练价值函数,将残差算法应用于有模型规划。
  • 修改TD(k)损失,通过强调真实转移并使用Huber损失替代均方误差,提升稳定性。
  • 采用Dyna风格的规划框架,利用学习到的模型生成虚拟转移用于价值函数训练。

实验结果

研究问题

  • RQ1能否通过新颖的目标网络设计,在深度RL中稳定残差算法?
  • RQ2所提出的残差DDPG是否在连续控制基准测试中优于原始DDPG?
  • RQ3残差算法能否在无需准确k步模型 rollout 的情况下,有效解决有模型规划中的分布不匹配问题?
  • RQ4基于残差的规划在样本效率和最终回报方面,与基于TD(k)的规划相比表现如何?

主要发现

  • Bi-Res-DDPG在η=0.05时,在28个DMControl任务中均获得显著更高的回报,评估曲线显示持续改进。
  • 双向目标网络技术稳定了残差学习,使得在朴素组合目标网络与残差算法时失败的训练也能稳定进行。
  • 在大多数有模型RL任务中,基于残差的规划优于基于TD(k)的规划,即使仅使用1步 rollout,而TD(k)需要准确的k步预测。
  • 采用Huber损失和改进损失公式的MVE-DDPG相比先前基线方法表现出更好的稳定性和性能,尤其在Hopper和Walker环境中。
  • 残差算法能有效将价值函数泛化到虚拟状态,减少分布不匹配,且不依赖于长时序模型的准确性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。