[论文解读] Transient Non-Stationarity and Generalisation in Deep Reinforcement Learning
本文识别出在深度强化学习中,由行为策略演化引起的瞬时非平稳性是导致泛化性能下降的关键因素,即使在平稳环境中也是如此。为应对这一问题,本文提出迭代重训练(Iterated Relearning, Iter),通过周期性地将策略蒸馏到新初始化的学生网络中,以减少训练过程中的非平稳性,显著提升了在ProcGen和Multiroom基准测试中的泛化性能。
Non-stationarity can arise in Reinforcement Learning (RL) even in stationary environments. For example, most RL algorithms collect new data throughout training, using a non-stationary behaviour policy. Due to the transience of this non-stationarity, it is often not explicitly addressed in deep RL and a single neural network is continually updated. However, we find evidence that neural networks exhibit a memory effect where these transient non-stationarities can permanently impact the latent representation and adversely affect generalisation performance. Consequently, to improve generalisation of deep RL agents, we propose Iterated Relearning (ITER). ITER augments standard RL training by repeated knowledge transfer of the current policy into a freshly initialised network, which thereby experiences less non-stationarity during training. Experimentally, we show that ITER improves performance on the challenging generalisation benchmarks ProcGen and Multiroom.
研究动机与目标
- 探究由变化的行为策略引起的深度强化学习中的瞬时非平稳性,即使在平稳环境中,如何影响泛化性能。
- 挑战灾难性遗忘完全解释性能下降的假设,提出在学习表征中存在记忆效应。
- 开发一种减少训练过程中非平稳性的实用训练范式,以提升深度强化学习智能体的泛化能力。
- 通过实证验证非平稳性损害泛化性能,且通过周期性重初始化网络可缓解此影响。
提出的方法
- 提出迭代重训练(Iter),一种训练范式,通过周期性地将当前策略和价值函数蒸馏到新初始化的学生网络中。
- 使用知识蒸馏将训练好的“教师”网络的策略和价值输出转移到新“学生”网络中,以最小化学生网络训练阶段的非平稳性。
- 在主训练过程中并行执行蒸馏,无需额外数据,仅引入极小的非平稳性。
- 在蒸馏过程中使用教师网络的软标签,以指导学生网络学习改进的潜在表征。
- 在一系列训练迭代中应用该方法,每次蒸馏后学生网络取代教师网络,实现在平稳数据分布上的持续重训练。
- 在Multiroom环境和ProcGen基准测试上验证该方法,比较在保留测试环境中的泛化性能。
实验结果
研究问题
- RQ1由变化行为策略引起的深度强化学习中的瞬时非平稳性,是否即使在平稳环境中也会降低泛化性能?
- RQ2深度神经网络在非平稳训练期间学到的次优或非最优特征在多大程度上会被保留,从而损害对未见输入的性能?
- RQ3通过知识蒸馏实现策略网络的周期性重初始化,能否提升深度强化学习智能体的泛化能力?
- RQ4与标准训练和其他正则化技术相比,迭代重训练在具有挑战性的基准测试中,其泛化性能表现如何?
- RQ5在非平稳训练期间学到的特征的相关性,在泛化性能下降中起什么作用?
主要发现
- 在CIFAR-10上的监督学习中,瞬时非平稳性导致测试性能显著下降,即使训练准确率几乎保持不变。
- 神经网络表现出记忆效应,即在非平稳训练期间学到的相关但次优的特征被保留,从而损害泛化,而非被遗忘。
- 表征矩阵的奇异值分解表明,当在相关但次优的数据上训练时,网络依赖更多特征,支持了遗留特征假说。
- 迭代重训练显著提升了ProcGen基准测试中的泛化性能,相比标准训练在保留测试环境中的表现更优。
- 迭代重训练在Multiroom环境中也提升了性能,表明其在多样化且具有挑战性的强化学习基准测试中的有效性。
- 该方法与现有正则化技术具有互补性,因为它直接针对由非平稳性引起的泛化失败根源,而正则化本身无法完全解决此问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。