Skip to main content
QUICK REVIEW

[论文解读] Training Larger Networks for Deep Reinforcement Learning

Kei Ota, Devesh K. Jha|arXiv (Cornell University)|Feb 16, 2021
Reinforcement Learning in Robotics参考文献 48被引用 10
一句话总结

本文提出一种三阶段方法,通过将表示学习与强化学习(DRL)解耦、采用宽残差块的DenseNet架构以改善特征传播、并利用分布式训练收集更多在线策略数据,从而实现更大规模深度强化学习(DRL)智能体的训练。该方法能够稳定训练极深且极宽的神经网络,显著提升在Ant-v2等具有挑战性的连续控制基准任务上的性能,优于当前最先进方法。

ABSTRACT

The success of deep learning in the computer vision and natural language processing communities can be attributed to training of very deep neural networks with millions or billions of parameters which can then be trained with massive amounts of data. However, similar trend has largely eluded training of deep reinforcement learning (RL) algorithms where larger networks do not lead to performance improvement. Previous work has shown that this is mostly due to instability during training of deep RL agents when using larger networks. In this paper, we make an attempt to understand and address training of larger networks for deep RL. We first show that naively increasing network capacity does not improve performance. Then, we propose a novel method that consists of 1) wider networks with DenseNet connection, 2) decoupling representation learning from training of RL, 3) a distributed training method to mitigate overfitting problems. Using this three-fold technique, we show that we can train very large networks that result in significant performance gains. We present several ablation studies to demonstrate the efficacy of the proposed method and some intuitive understanding of the reasons for performance gain. We show that our proposed method outperforms other baseline algorithms on several challenging locomotion tasks.

研究动机与目标

  • 解决在深度强化学习中简单增大网络规模时出现的训练不稳定和性能提升不足的问题。
  • 理解为何在计算机视觉和自然语言处理中表现优异的大规模网络在DRL中却表现不佳。
  • 开发一种稳定且可扩展的方法,用于在DRL中训练极深且极宽的神经网络。
  • 证明通过网络架构和训练策略的改进,而非仅调整超参数,即可在DRL中实现性能提升。

提出的方法

  • 通过训练一个特征提取器(OFENet)使用辅助损失预测下一个状态,将表示学习与强化学习解耦,从而获得更丰富、更具信息量的特征。
  • 采用类似DenseNet的架构,结合宽残差块,以增强层间特征传播和信息流动。
  • 采用类似Ape-X的分布式训练框架,收集大量在线策略转移数据,减少过拟合并提升泛化能力。
  • 在使用强化学习策略进行微调之前,先独立地在自监督的下一个状态预测任务上预训练表示网络(OFENet)。
  • 将大规模预训练的特征提取器与标准SAC智能体结合,将提取的特征作为策略和Q网络的输入。
  • 通过有效秩分析和损失曲面可视化,解释网络架构选择对训练稳定性和性能的影响。

实验结果

研究问题

  • RQ1为何在监督学习中表现优异的大规模网络在深度强化学习中无法提升性能?
  • RQ2将表示学习与强化学习解耦是否能提升DRL中的训练稳定性和性能?
  • RQ3DenseNet架构如何促进DRL中更深更宽网络的训练?
  • RQ4分布式在线策略数据收集在多大程度上能缓解大规模DRL网络中的过拟合问题?
  • RQ5各组件(表示学习、DenseNet、分布式训练)对最终性能提升的相对贡献如何?

主要发现

  • 所提方法在Ant-v2环境中显著优于标准SAC,平均回报高于基线方法和当前最先进算法。
  • 消融实验表明,若移除OFENet、DenseNet或分布式训练中的任一核心组件,性能均出现显著下降,证实了各组件的独立贡献。
  • 在不进行架构或训练策略修改的情况下,单纯使用更大网络(每层2048个神经元)会导致性能欠佳,证实了简单扩展的不稳定性。
  • 仅使用OFENet组件即可在标准强化学习训练基础上提升性能,表明使用辅助任务进行预训练具有显著优势。
  • 与标准MLP相比,DenseNet架构能进一步提升性能,表明在DRL中大网络的强特征传播能力至关重要。
  • 损失曲面可视化与有效秩分析表明,所提方法能产生更平坦、更稳定的损失曲面,支持更好的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。