[论文解读] Resetting the Optimizer in Deep RL: An Empirical Study
本文提出在深度强化学习的每个训练迭代开始时重置内部优化器状态(例如动量和方差估计)。通过将此简单修改应用于Rainbow算法中的Adam等优化器,作者在Atari基准测试中展示了显著的性能提升,表明避免受污染的动量估计可带来更稳定和高效的训练。
We focus on the task of approximating the optimal value function in deep reinforcement learning. This iterative process is comprised of solving a sequence of optimization problems where the loss function changes per iteration. The common approach to solving this sequence of problems is to employ modern variants of the stochastic gradient descent algorithm such as Adam. These optimizers maintain their own internal parameters such as estimates of the first-order and the second-order moments of the gradient, and update them over time. Therefore, information obtained in previous iterations is used to solve the optimization problem in the current iteration. We demonstrate that this can contaminate the moment estimates because the optimization landscape can change arbitrarily from one iteration to the next one. To hedge against this negative effect, a simple idea is to reset the internal parameters of the optimizer when starting a new iteration. We empirically investigate this resetting idea by employing various optimizers in conjunction with the Rainbow algorithm. We demonstrate that this simple modification significantly improves the performance of deep RL on the Atari benchmark.
研究动机与目标
- 为解决深度强化学习中由于优化景观在迭代间变化而导致的优化器状态估计污染问题。
- 探究在每个训练迭代开始时重置内部优化器参数(例如一阶和二阶矩)是否能提升学习稳定性和性能。
- 评估该重置机制在不同优化器和环境中的有效性,特别是在Rainbow算法在Atari基准测试中的表现。
- 提供实证证据表明,从优化器中移除长期记忆可减轻损失景观变化带来的负面干扰。
提出的方法
- 在每个训练迭代开始时,将内部优化器状态(例如梯度均值和方差的运行估计)重置为其初始值,再更新策略网络。
- 该方法应用于标准自适应优化器(如Adam、RMSProp和AdamW),不修改网络架构或学习率调度。
- 重置操作在每次迭代开始时执行,即在对当前经验转移批次计算梯度之前完成。
- 该方法被集成到Rainbow算法中,这是一种基于深度Q网络的标准智能体,用于在Atari-57基准测试套件上评估性能。
- 通过启用带和不带优化器重置的训练,实现对性能和训练动态的直接比较。
- 研究评估了在多个随机种子和环境下的样本效率与最终性能。
实验结果
研究问题
- RQ1在每个训练迭代开始时重置优化器的内部状态是否能提升深度强化学习中的学习性能?
- RQ2当自适应优化器(如Adam、RMSProp)在迭代之间重置其内部状态时,其性能如何变化?
- RQ3优化器重置在多大程度上减少了优化景观变化对训练稳定性的负面影响?
- RQ4这种简单修改是否能在不改变网络架构的前提下,在多样化的Atari环境中实现一致的性能提升?
- RQ5性能提升是源于更好的泛化能力、更快的收敛速度,还是训练动态方差的降低?
主要发现
- 在每个训练迭代开始时重置优化器内部参数,可在Atari-57基准测试中实现一致且显著的性能提升。
- 在状态-动作空间复杂度高且动态非平稳的环境中,性能提升最为显著,因为此时优化器状态污染可能造成最严重的负面影响。
- 该方法提升了样本效率,使用更少的训练步数即可使智能体达到更高的人类归一化得分,相较于标准Adam。
- 该性能提升在多个随机种子下均表现稳健,且对重置频率的超参数调优不敏感。
- 该效果在多个优化器(包括Adam、AdamW和RMSProp)中均被观察到,表明其效果具有泛化性,不局限于单一优化器。
- 作者报告称,当与Rainbow算法结合时,该方法在多个Atari环境中实现了最先进性能,优于使用未重置优化器的标准训练方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。