[论文解读] The State of Sparse Training in Deep Reinforcement Learning
本文系统评估了稀疏训练技术——剪枝、静态稀疏性、SET 和 RigL——在深度强化学习(DRL)中的表现,表明在 DQN、SAC 和 PPO 代理中,相同参数量下稀疏网络的性能优于密集网络。主要发现是,高达 80–90% 的稀疏网络可实现接近密集网络的性能,其中动态稀疏性和非均匀参数分配(尤其是偏向评论家网络)可获得最佳结果。
The use of sparse neural networks has seen rapid growth in recent years, particularly in computer vision. Their appeal stems largely from the reduced number of parameters required to train and store, as well as in an increase in learning efficiency. Somewhat surprisingly, there have been very few efforts exploring their use in Deep Reinforcement Learning (DRL). In this work we perform a systematic investigation into applying a number of existing sparse training techniques on a variety of DRL agents and environments. Our results corroborate the findings from sparse training in the computer vision domain - sparse networks perform better than dense networks for the same parameter count - in the DRL domain. We provide detailed analyses on how the various components in DRL are affected by the use of sparse networks and conclude by suggesting promising avenues for improving the effectiveness of sparse training methods, as well as for advancing their use in DRL.
研究动机与目标
- 探究计算机视觉中有效的稀疏训练技术是否可迁移至深度强化学习(DRL)。
- 评估多种稀疏训练方法——剪枝、静态稀疏性、SET 和 RigL——在在线训练设置下的 DRL 代理性能。
- 分析架构和训练超参数(如稀疏性分布、权重衰减、批量大小、初始化)对稀疏 DRL 性能的影响。
- 确定稀疏网络是否能提升 DRL 中的鲁棒性和泛化能力,尤其是在存在观测噪声的情况下。
- 为实际部署稀疏 DRL 代理提供可操作建议,包括最优参数分配和稀疏性策略。
提出的方法
- 将四种稀疏训练算法——剪枝、静态稀疏性、SET 和 RigL——应用于基于值函数(DQN)和演员-评论家(SAC、PPO)的 DRL 代理。
- 采用 Erdős–Rényi 核(ERK)稀疏性分布实现结构化稀疏性,并在演员和评论家网络之间实现非均匀参数分配。
- 在受控超参数设置下(包括批量大小、权重衰减和初始化方案),于多个环境(如 Atari、MuJoCo)中评估稀疏性表现。
- 通过拓扑更新策略实现动态稀疏性,其中 RigL 支持训练过程中基于梯度的权重增长。
- 开展关于梯度信噪比(SNR)、批量大小和稀疏性更新频率的消融研究,以评估训练稳定性。
- 使用 GitHub 上的代码(github.com/google-research/rigl/tree/master/rigl/rl)复现结果,确保可复现性。
实验结果
研究问题
- RQ1在 DRL 中,稀疏神经网络是否能在相同参数量下实现与密集网络相当的性能,如同在计算机视觉中所见?
- RQ2在在线 DRL 训练中,剪枝、静态稀疏性、SET 或 RigL 哪种稀疏训练方法表现最佳?
- RQ3架构选择(如演员-评论家参数比例和稀疏性分布)如何影响 DRL 训练的稳定性和性能?
- RQ4稀疏性是否能提升 DRL 环境中对观测噪声的鲁棒性?
- RQ5尽管在视觉任务中表现优异,RigL 在 DRL 中为何表现不如剪枝?低梯度信噪比(SNR)在高稀疏性阶段是否为潜在原因?
主要发现
- 在所有评估的 DRL 代理和环境中,稀疏神经网络在相同参数量下始终优于密集网络。
- 高达 80–90% 稀疏性的网络性能可保持在密集基线的 5% 以内,展现出强大的参数效率。
- 所有稀疏训练方法中,剪枝表现最佳;而动态稀疏训练(如 SET)显著优于静态稀疏性。
- 基于梯度的权重增长(RigL)改善有限,可能是因为在高稀疏性训练期间梯度的信噪比(SNR)较低。
- 通过将大部分参数分配给评论家网络并采用基于 ERK 的稀疏性模式,可实现最优性能。
- 稀疏网络对观测噪声表现出更强的鲁棒性,表明其在泛化能力和实际部署中具有潜在优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。