[论文解读] Deep Reinforcement Learning with Decorrelation
本文提出了一种简单但有效的正则化方法,通过在损失函数中添加相关性惩罚项,以减少深度强化学习(DRL)中特征的相关性。通过降低深度Q网络(DQN)和分位数回归DQN(QR-DQN)中的特征相关性,该方法提升了学习效率和性能,在49款Atari游戏中实现了70%的人类标准化得分——比标准DQN高出40%,在39款游戏中表现显著提升,仅在6款游戏中有轻微损失。
Learning an effective representation for high-dimensional data is a challenging problem in reinforcement learning (RL). Deep reinforcement learning (DRL) such as Deep Q networks (DQN) achieves remarkable success in computer games by learning deeply encoded representation from convolution networks. In this paper, we propose a simple yet very effective method for representation learning with DRL algorithms. Our key insight is that features learned by DRL algorithms are highly correlated, which interferes with learning. By adding a regularized loss that penalizes correlation in latent features (with only slight computation), we decorrelate features represented by deep neural networks incrementally. On 49 Atari games, with the same regularization factor, our decorrelation algorithms perform $70\%$ in terms of human-normalized scores, which is $40\%$ better than DQN. In particular, ours performs better than DQN on 39 games with 4 close ties and lost only slightly on $6$ games. Empirical results also show that the decorrelation method applies to Quantile Regression DQN (QR-DQN) and significantly boosts performance. Further experiments on the losing games show that our decorelation algorithms can win over DQN and QR-DQN with a fined tuned regularization factor.
研究动机与目标
- 解决DRL中使用的深度神经网络存在高特征相关性的问题,该问题会阻碍学习效率和性能。
- 开发一种单阶段、端到端的方法,同时学习有效表征并解决控制任务,无需依赖辅助任务或经验回放。
- 通过显式减少学习到的潜在特征之间的相关性,提升DQN和QR-DQN的泛化能力和稳定性。
- 测试去相关方法在不同DRL架构中的泛化能力,包括QR-DQN等分布式RL算法。
- 探究某些游戏中性能不佳是否源于超参数选择不当,而非方法本身的局限性。
提出的方法
- 引入一种正则化损失函数,惩罚深度神经网络隐藏层中特征之间的均方相关性。
- 从最后一层卷积层的激活值中计算特征协方差矩阵,并施加一个与非对角线元素平方和成比例的正则化项。
- 将相关性惩罚项添加到标准DQN或QR-DQN损失中,其中超参数λ控制去相关强度。
- 使用随机梯度下降端到端训练网络,联合损失项同时鼓励预测准确性和特征去相关性。
- 在全部49款Atari游戏中使用相同的正则化因子λ以评估泛化能力,并在表现较差的游戏上微调λ以提升性能。
- 将相同的去相关机制应用于QR-DQN,证明其在不同DRL算法间的可迁移性。
实验结果
研究问题
- RQ1DRL表征中特征的高相关性是否会导致学习性能下降并减缓收敛?
- RQ2一种简单且可微分的正则化项,通过惩罚特征相关性,是否能显著提升DQN在多样化环境中的性能?
- RQ3该去相关方法是否能泛化到其他DRL算法,如QR-DQN这一分布式RL变体?
- RQ4某些Atari游戏中性能下降是否源于正则化超参数选择不当,而非方法本身失效?
- RQ5去相关特征是否能带来更具可解释性或更低冗余性的DRL模型表征?
主要发现
- 该去相关方法使DQN性能提升至70%人类标准化得分,在49款Atari游戏中相较标准DQN实现了40%的相对提升。
- 在39款游戏中,去相关DQN(DQN-decor)优于标准DQN,4款游戏表现接近,仅6款游戏出现轻微性能下降。
- 应用于QR-DQN时,该去相关方法显著提升了中位数人类标准化得分,在34款游戏中获胜(累计奖励提升超过5%),5款游戏失败,10款游戏表现接近。
- 性能下降的游戏问题被归因于正则化因子选择不当,通过微调λ可恢复强劲性能,表明该方法具有鲁棒性。
- 特征协方差分析显示,与标准DQN相比,DQN-decor的非对角线相关性幅度显著降低,且激活的冗余特征更少。
- 可视化结果表明,DQN-decor在每帧输入中同时激活的特征更少,表明其表征更稀疏、更独立,可能提升可解释性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。