[论文解读] Loss of Plasticity in Continual Deep Reinforcement Learning
本文识别并分析了在连续训练一系列Atari 2600游戏时,深度强化学习智能体在持续学习过程中出现的灾难性可塑性丧失现象,其原因是激活稀疏性导致梯度更新能力下降。本文提出了一种简单而有效的缓解方法——连接ReLU(CReLUs),通过恢复梯度流动,使智能体能够在非平稳环境中实现持续学习。
The ability to learn continually is essential in a complex and changing world. In this paper, we characterize the behavior of canonical value-based deep reinforcement learning (RL) approaches under varying degrees of non-stationarity. In particular, we demonstrate that deep RL agents lose their ability to learn good policies when they cycle through a sequence of Atari 2600 games. This phenomenon is alluded to in prior work under various guises -- e.g., loss of plasticity, implicit under-parameterization, primacy bias, and capacity loss. We investigate this phenomenon closely at scale and analyze how the weights, gradients, and activations change over time in several experiments with varying dimensions (e.g., similarity between games, number of games, number of frames per game), with some experiments spanning 50 days and 2 billion environment interactions. Our analysis shows that the activation footprint of the network becomes sparser, contributing to the diminishing gradients. We investigate a remarkably simple mitigation strategy -- Concatenated ReLUs (CReLUs) activation function -- and demonstrate its effectiveness in facilitating continual learning in a changing environment.
研究动机与目标
- 研究为何像Rainbow这样的标准深度强化学习智能体在非平稳环境的持续学习设置中表现不佳。
- 分析导致在连续训练一系列Atari游戏过程中可塑性丧失的潜在机制,特别是权重、梯度和激活动态的变化。
- 评估架构修改是否能在分布漂移和记忆约束的条件下恢复持续强化学习中的学习能力。
- 证明CReLUs能够缓解激活稀疏性并恢复梯度流动,从而在重复访问游戏时实现持续的策略改进。
提出的方法
- 在5至10款Atari 2600游戏中连续训练一个Rainbow DQN智能体,不进行重置,历时50天,共经历20亿次环境交互。
- 在持续训练过程中,监控并分析了各层网络权重、梯度范数(ℓ₂、ℓ₁、ℓ₀)以及激活稀疏性(ℓ₀范数)的演变过程。
- 将标准ReLU激活函数与CReLUs进行对比,CReLUs通过使用两个并行的ReLU单元来保持激活多样性,防止激活崩溃。
- 采用不间断单个游戏训练的基线(每款游戏训练2亿帧)作为性能上限,用于对比分析。
- 通过评估在重复访问游戏时的表现,检测遗忘、首因偏差和可塑性丧失现象。
- 分析梯度流动和激活足迹的变化,将网络结构行为与学习退化现象相关联。

实验结果
研究问题
- RQ1当在一系列非平稳Atari游戏上连续训练时,标准深度强化学习智能体(如Rainbow)的可塑性丧失程度如何?
- RQ2在存在分布漂移的持续学习设置中,权重更新、梯度范数和激活稀疏性如何随时间演变?
- RQ3架构修改(如CReLUs)是否能够逆转或缓解标准ReLU智能体中观察到的可塑性丧失?
- RQ4CReLU激活函数是否能恢复足够的梯度流动,从而在重复访问游戏时实现有意义的策略改进?
- RQ5与从零开始在每款游戏中单独训练的非持续智能体相比,采用CReLUs的持续智能体性能如何?
主要发现
- 在连续训练一系列Atari游戏时,Rainbow智能体表现出灾难性的可塑性丧失,重复访问同一游戏时性能持续下降,表明其无法有效学习或保留知识。
- 激活稀疏性随时间显著增加,仅有极少数神经元产生非零激活,导致梯度流动减弱,学习能力下降。
- CReLUs能有效缓解激活稀疏性,恢复梯度范数,从而在重复访问游戏时实现持续学习。
- 尽管CReLUs提升了可塑性,但持续训练的智能体仍无法达到从零开始在每款游戏上单独训练的非持续智能体的性能水平,表明灾难性干扰问题仍未解决。
- 随着游戏访问次数的增加,持续CReLU智能体与非持续基线之间的性能差距在如Atlantis和Boxing等游戏中持续扩大,凸显了持续遗忘现象。
- 可塑性丧失现象与网络结构变化密切相关,特别是激活崩溃和梯度抑制,而不仅仅是数据分布漂移所致。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。