[论文解读] D2RL: Deep Dense Architectures in Reinforcement Learning
本文提出D2RL,一种用于强化学习的深度密集架构,通过在策略网络和价值函数网络中引入多层之间的密集跳跃连接,提升了样本效率。该方法在使用本体感觉和基于图像的观测的多样化机器人控制任务中表现出一致的性能提升,优于标准MLP和ResNet基线模型,尤其在更深的网络中,传统架构失效时表现更优。
While improvements in deep learning architectures have played a crucial role in improving the state of supervised and unsupervised learning in computer vision and natural language processing, neural network architecture choices for reinforcement learning remain relatively under-explored. We take inspiration from successful architectural choices in computer vision and generative modelling, and investigate the use of deeper networks and dense connections for reinforcement learning on a variety of simulated robotic learning benchmark environments. Our findings reveal that current methods benefit significantly from dense connections and deeper networks, across a suite of manipulation and locomotion tasks, for both proprioceptive and image-based observations. We hope that our results can serve as a strong baseline and further motivate future research into neural network architectures for reinforcement learning. The project website with code is at this link https://sites.google.com/view/d2rl/home.
研究动机与目标
- 研究深度神经网络在深度强化学习策略和价值函数近似中的性能退化问题。
- 解决在深度强化学习中使用更深网络时出现的优化困难和性能崩溃问题。
- 提出一种可泛化的架构解决方案——D2RL,通过密集连接提升样本效率。
- 在包含图像和本体感觉观测的多样化机器人控制环境中,评估D2RL的有效性。
- 确立D2RL作为未来深度强化学习架构研究的强基准。
提出的方法
- D2RL采用密集跳跃连接,其中每一层将输入与所有先前层的输出进行拼接,灵感来源于DenseNet和U-Net架构。
- 该方法通过用密集架构替代标准演员-评论家网络中的全连接层,实现所有层之间的特征复用。
- 该架构被应用于SAC和CURL等异策略算法中的策略和Q值网络,同时保持与现有训练框架的兼容性。
- 模型使用恒等映射将输入通过所有层传递,以促进梯度流动,减轻深层网络中的梯度消失问题。
- 在实验中保持超参数一致,以隔离架构的影响,与原始MLP和ResNet变体进行比较。
- 该方法在DM Control Suite和OpenAI Gym环境上进行评估,使用图像和状态观测两种输入形式。
实验结果
研究问题
- RQ1在深度强化学习中,增加神经网络深度对策略和价值函数性能有何影响?
- RQ2密集连接是否能缓解用于DRL的更深网络中的性能退化问题?
- RQ3与标准MLP和基于ResNet的网络相比,D2RL架构是否提升了样本效率?
- RQ4D2RL的优势是否在不同观测模态(图像与本体感觉)和强化学习算法间保持一致?
- RQ5将D2RL应用于策略网络与价值网络,其相对贡献如何?
主要发现
- D2RL显著提升了连续控制任务中的样本效率,减少了达到高性能所需的环境交互次数。
- 在所有评估任务中,D2RL均优于原始MLP和基于ResNet的网络,尤其在更深的架构中,原始网络失效时表现更优。
- 同时将D2RL应用于策略网络和Q值网络可获得最高性能,其中仅价值网络参数化带来的相对增益强于仅策略网络。
- 更深的D2RL网络(如8层)的性能几乎与更浅的网络(4层)相当,而原始MLP网络则随深度增加而性能下降。
- 消融实验确认,密集连接有效缓解了DRL中深层网络性能崩溃的问题。
- 结果表明,架构归纳偏置(如密集连接)对于提升DRL中的泛化能力和优化性能至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。