Skip to main content
QUICK REVIEW

[论文解读] The Impact of Non-stationarity on Generalisation in Deep Reinforcement Learning

Maximilian Igl, Gregory Farquhar|arXiv (Cornell University)|Jun 10, 2020
Reinforcement Learning in Robotics参考文献 28被引用 15
一句话总结

本文识别出深度强化学习中的非平稳性——由不断演化的策略和变化的训练目标引起——是损害泛化能力的关键因素。本文提出迭代重训练(ITER),通过反复将已训练策略的知识迁移至新初始化的网络中,降低非平稳性,从而在ProcGen和Multiroom基准测试中提升性能。

ABSTRACT

Non-stationarity arises in Reinforcement Learning (RL) even in stationary environments. Most RL algorithms collect new data throughout training, using a non-stationary behaviour policy. Furthermore, training targets in RL can change even with a fixed state distribution when the policy, critic, or bootstrap values are updated. We study these types of non-stationarity in supervised learning settings as well as in RL, finding that they can lead to worse generalisation performance when using deep neural network function approximators. Consequently, to improve generalisation of deep RL agents, we propose Iterated Relearning (ITER). ITER augments standard RL training by repeated knowledge transfer of the current policy into a freshly initialised network, which thereby experiences less non-stationarity during training. Experimentally, we show that ITER improves performance on the challenging generalisation benchmarks ProcGen and Multiroom.

研究动机与目标

  • 研究函数近似器在深度强化学习中,策略和训练目标的非平稳性如何负面影响泛化能力。
  • 使用深度网络分析非平稳性在监督学习和强化学习设置中的影响。
  • 开发一种在策略学习过程中减少非平稳性的训练方法,以提升泛化性能。
  • 通过实验验证在ProcGen和Multiroom等复杂基准测试中泛化能力的改进。

提出的方法

  • ITER通过反复将当前策略的知识迁移至新初始化的神经网络中,以降低训练过程中的非平稳性。
  • 该方法使用知识蒸馏技术,定期将已训练网络的策略行为迁移至全新、随机初始化的网络中。
  • 训练以循环方式进行:先训练一个策略,然后将其知识迁移至新网络,再从头开始微调该新网络。
  • 该过程迭代减少非平稳目标和行为策略对学习过程的影响。
  • 该方法保持标准强化学习训练目标,但引入周期性重新初始化和知识迁移,以稳定学习动态。
  • 实验中将该方法应用于基于值函数和基于策略的强化学习算法。

实验结果

研究问题

  • RQ1策略和训练目标的非平稳性在使用函数近似器的深度强化学习中,如何影响泛化能力?
  • RQ2在新初始化网络中应用知识蒸馏,在多大程度上能降低训练过程中的非平稳性?
  • RQ3迭代重训练能否在ProcGen和Multiroom等复杂多样的强化学习基准测试中提升泛化能力?
  • RQ4与标准训练相比,ITER在样本效率和对分布偏移的鲁棒性方面表现如何?
  • RQ5非平稳性的降低是否导致在多样化环境中生成更稳定、更具泛化能力的策略?

主要发现

  • 即使在静态环境中,策略和训练目标的非平稳性也会显著降低深度强化学习中的泛化性能。
  • 在ProcGen基准测试中,ITER相比标准训练实现了更高的平均分和中位数得分。
  • 在Multiroom环境中,ITER在未见过的测试关卡上表现出更优的泛化能力,表明其鲁棒性更强。
  • 该方法有效减轻了非平稳目标和行为策略的负面影响,使学习动态更加稳定。
  • 将知识迁移至新初始化的网络,能有效缓解训练过程中的非平稳性影响。
  • ITER在不修改底层强化学习算法或超参数的前提下,实现了在多个环境中的稳定性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。