Skip to main content
QUICK REVIEW

[论文解读] Recurrent Off-policy Baselines for Memory-based Continuous Control

Zhihan Yang, Van‐Dinh Nguyen|arXiv (Cornell University)|Oct 25, 2021
Reinforcement Learning in Robotics参考文献 31被引用 13
一句话总结

本文通过使用循环神经网络(RNN)进行基于记忆的时序表征,将DDPG、TD3和SAC扩展为处理部分可观察连续控制任务的递归离策略深度强化学习算法——RDPG、RTD3和RSAC。RSAC在各类任务中表现最为可靠,接近最优性能,尽管系统性探索仍具挑战。

ABSTRACT

When the environment is partially observable (PO), a deep reinforcement learning (RL) agent must learn a suitable temporal representation of the entire history in addition to a strategy to control. This problem is not novel, and there have been model-free and model-based algorithms proposed for this problem. However, inspired by recent success in model-free image-based RL, we noticed the absence of a model-free baseline for history-based RL that (1) uses full history and (2) incorporates recent advances in off-policy continuous control. Therefore, we implement recurrent versions of DDPG, TD3, and SAC (RDPG, RTD3, and RSAC) in this work, evaluate them on short-term and long-term PO domains, and investigate key design choices. Our experiments show that RDPG and RTD3 can surprisingly fail on some domains and that RSAC is the most reliable, reaching near-optimal performance on nearly all domains. However, one task that requires systematic exploration still proved to be difficult, even for RSAC. These results show that model-free RL can learn good temporal representation using only reward signals; the primary difficulty seems to be computational cost and exploration. To facilitate future research, we have made our PyTorch implementation publicly available at https://github.com/zhihanyang2022/off-policy-continuous-control.

研究动机与目标

  • 填补在部分可观察环境中,基于记忆的连续控制任务中,无模型、离策略基线的空白。
  • 实现并评估DDPG、TD3和SAC的递归版本(RDPG、RTD3、RSAC),利用完整的观测-动作历史。
  • 研究关键设计选择,如共享递归表征以及RNN架构(LSTM、GRU、VRNN)在离策略强化学习中的影响。
  • 为未来基于历史的深度强化学习研究建立一个可靠且公开可用的实现。
  • 评估无模型强化学习在稀疏奖励、系统性探索任务中的局限性,尽管其在密集奖励领域表现强劲。

提出的方法

  • 通过引入循环神经网络(RNN)扩展DDPG、TD3和SAC,以处理完整历史 $ h_t = \{o_{1:t}, a_{1:t-1}\} $,形成RDPG、RTD3和RSAC。
  • 通过存储完整历史并利用RNN隐藏状态维持时序上下文,对递归智能体的常规经验回放机制进行适配。
  • 提出RSAC-Share:在智能体和两个评论家之间共享一个递归编码器,仅通过评论家损失进行优化,以提升效率和表征质量。
  • 采用基于梯度的时间反向传播(BPTT)对RNN、智能体和评论家进行端到端训练。
  • 比较不同RNN类型(LSTM、GRU、VRNN)在基于记忆的控制任务中对性能和训练稳定性的影响。
  • 借鉴DrQ [21]的见解,在基于图像的强化学习中共享单一CNN,类似地将该原则应用于RNN以实现参数效率和表征学习。

实验结果

研究问题

  • RQ1具有RNN的离策略深度强化学习算法能否仅从稀疏奖励信号中,在部分可观察环境中学习到有效的时序表征?
  • RQ2如共享递归表征和RNN架构(LSTM vs. GRU vs. VRNN)等设计选择如何影响学习稳定性和性能?
  • RQ3在智能体和评论家之间共享递归编码器是否能提升样本效率和性能,其在训练动态中的权衡为何?
  • RQ4在短期和长期部分可观察控制任务中,RDPG、RTD3和RSAC在可靠性与渐近性能方面如何比较?
  • RQ5在无模型强化学习中,POMDPs任务的持久挑战是什么,特别是在需要稀疏奖励下进行系统性探索的任务中?

主要发现

  • RSAC在几乎所有测试的部分可观察连续控制领域中均实现接近最优性能,优于RDPG和RTD3。
  • RDPG和RTD3在某些任务中意外失败,表明即使在离策略算法中,值函数高估和策略崩溃问题依然存在。
  • RSAC-Share(共享递归编码器仅通过评论家损失优化)在性能上与RSAC相当,但将RNN计算量减半,显著缩短训练时间。
  • RSAC-Share表现出两个评论家Q值之间更高的相关性(因共享表征),可能降低裁剪双Q学习的有效性。
  • RSAC-LSTM与RSAC-GRU在渐近性能上表现相当,而RSAC-VRNN显著表现较差,可能由于长序列中梯度消失/爆炸问题。
  • 尽管在密集奖励任务中表现强劲,所有模型在单一需要系统性探索的任务中均表现不佳,凸显了无模型强化学习在POMDPs中持续存在的挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。