[论文解读] The Dormant Neuron Phenomenon in Deep Reinforcement Learning
本文识别出深度强化学习中的“休眠神经元现象”,即神经元在训练过程中变得不活跃,导致网络表达能力下降。作者提出 ReDo 方法,通过定期重置休眠神经元的权重使其重新激活,从而保持网络容量,并在多种强化学习算法和环境中提升样本效率与性能。
In this work we identify the dormant neuron phenomenon in deep reinforcement learning, where an agent's network suffers from an increasing number of inactive neurons, thereby affecting network expressivity. We demonstrate the presence of this phenomenon across a variety of algorithms and environments, and highlight its effect on learning. To address this issue, we propose a simple and effective method (ReDo) that Recycles Dormant neurons throughout training. Our experiments demonstrate that ReDo maintains the expressive power of networks by reducing the number of dormant neurons and results in improved performance.
研究动机与目标
- 探究尽管模型过参数化,深度强化学习智能体为何会损失网络表达能力。
- 识别深度强化学习中学习性能下降的根本原因,特别是不活跃神经元的出现。
- 开发一种轻量级、非破坏性的方法,以在训练过程中保持网络容量。
- 在不引发灾难性遗忘的前提下,提升深度强化学习智能体的样本效率与最终性能。
- 证明休眠神经元现象在多种强化学习算法与环境中的普适性。
提出的方法
- 作者将休眠神经元定义为在一批输入上激活值低于阈值(例如 1e-4)的神经元。
- 提出 ReDo 方法,通过将休眠神经元的权重重置为小范围随机初始化,使其重新激活。
- ReDo 在训练过程中以固定间隔应用,不修改网络其余部分或学习过程。
- 该方法使用超参数阈值,基于小批量输入的激活统计量识别休眠神经元。
- ReDo 设计为与标准强化学习算法兼容,无需架构修改。
- 该方法通过保留所有先前学习的权重,仅修改不活跃神经元,避免灾难性遗忘。

实验结果
研究问题
- RQ1为何深度强化学习智能体尽管过参数化,仍会出现网络表达能力下降?
- RQ2休眠神经元数量在训练过程中增加的程度如何?其变化在不同算法与环境中是否存在差异?
- RQ3重新激活休眠神经元能否提升深度强化学习中的学习性能与样本效率?
- RQ4与完整网络权重重置或其他正则化技术相比,ReDo 在性能与稳定性方面表现如何?
- RQ5休眠神经元现象是否也存在于演员-评论家方法及连续控制环境中?
主要发现
- 在 DQN、DrQ 和 SAC 智能体中,休眠神经元数量随训练时间显著增加,尤其在梯度更新频率较高时。
- 该现象在监督学习中不存在,表明其为强化学习训练中特有的动态行为。
- ReDo 在训练过程中可将休眠神经元数量减少最多 50%,从而维持更高的网络表达能力。
- 在 17 个 Atari 游戏中,DQN 搭配 ReDo 的性能优于所有其他方法,包括网络重置与权重衰减。
- ReDo 显著提升样本效率,其人类归一化 IQM 分数在离散控制与连续控制任务中均持续优于基线方法。
- 该方法在多种算法与环境中均有效,展现出广泛适用性,且无需对网络架构或超参数进行大规模调整。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。