[论文解读] Selfish Sparse RNN Training
本文提出 Selfish-RNN,一种从零开始训练稀疏循环神经网络(RNN)的方法,采用固定参数数量,结合一种新型稀疏优化器(SNT-ASGD)和非均匀的门控权重重分配策略,以提升正则化效果。该方法在 Penn TreeBank 和 Wikitext-2 数据集上实现了最先进性能,优于 RNN 设置下的密集模型剪枝方法。
Sparse neural networks have been widely applied to reduce the computational demands of training and deploying over-parameterized deep neural networks. For inference acceleration, methods that discover a sparse network from a pre-trained dense network (dense-to-sparse training) work effectively. Recently, dynamic sparse training (DST) has been proposed to train sparse neural networks without pre-training a dense model (sparse-to-sparse training), so that the training process can also be accelerated. However, previous sparse-to-sparse methods mainly focus on Multilayer Perceptron Networks (MLPs) and Convolutional Neural Networks (CNNs), failing to match the performance of dense-to-sparse methods in the Recurrent Neural Networks (RNNs) setting. In this paper, we propose an approach to train intrinsically sparse RNNs with a fixed parameter count in one single run, without compromising performance. During training, we allow RNN layers to have a non-uniform redistribution across cell gates for better regularization. Further, we propose SNT-ASGD, a novel variant of the averaged stochastic gradient optimizer, which significantly improves the performance of all sparse training methods for RNNs. Using these strategies, we achieve state-of-the-art sparse training results, better than the dense-to-sparse methods, with various types of RNNs on Penn TreeBank and Wikitext-2 datasets. Our codes are available at https://github.com/Shiweiliuiiiiiii/Selfish-RNN.
研究动机与目标
- 为解决现有动态稀疏训练(DST)方法在 RNN 中表现不佳的问题,这些方法的性能落后于密集到稀疏的方法。
- 实现从零开始的端到端稀疏 RNN 训练,且参数数量固定,避免对密集模型进行预训练。
- 通过在 LSTM 单元门控之间非均匀地重新分配权重,提升稀疏 RNN 的泛化能力和性能。
- 开发一种新型优化器 SNT-ASGD,适用于稀疏训练,可提升各类 RNN 架构的收敛性和性能。
- 分析稀疏连接的拓扑结构,揭示 RNN 中权重增长与稀疏性分布的反直觉发现。
提出的方法
- 提出 SNT-ASGD,一种带有非单调平均的稀疏平均随机梯度下降变体,专为稀疏 RNN 训练而设计。
- 在训练过程中,对 LSTM 单元的各个门控(输入、遗忘、细胞、输出)实施非均匀的权重重分配,以增强正则化效果。
- 在整个训练过程中保持固定的稀疏度,避免迭代式的剪枝或增长阶段。
- 采用图论度量方法,量化不同稀疏连接模式之间的拓扑距离。
- 采用反向传播机制,跳过零权重参数的计算,从而减少 FLOPs,且无需存储不存在的梯度。
- 在 RNN 中评估了多种稀疏度分布(均匀分布、Erdős-Rényi 分布、ERK)和权重增长策略(随机 vs. 基于梯度)的影响。
实验结果
研究问题
- RQ1动态稀疏训练能否在 RNN 中实现与密集到稀疏方法相当的最先进性能?
- RQ2在 LSTM 单元门控之间非均匀地重新分配权重,是否能提升泛化能力和模型性能?
- RQ3稀疏度分布的选择(均匀分布 vs. Erdős-Rényi 分布)如何影响稀疏 RNN 的性能?
- RQ4为何在稀疏 RNN 训练中,基于随机的权重增长策略优于基于梯度的策略?
- RQ5低损失稀疏 RNN 架构的拓扑多样性如何?它们之间有何不同?
主要发现
- Selfish-RNN 在 Penn TreeBank 和 Wikitext-2 上实现了最先进性能,优于密集到稀疏剪枝方法以及现有的 DST 方法。
- 在所有 RNN 模型中,遗忘门的权重始终最稀疏,而细胞门和输出门的权重则比平均值更密集。
- 在稀疏 RNN 训练中,基于随机的权重增长优于基于梯度的增长策略,这与卷积神经网络(CNNs)和多层感知机(MLPs)中的发现相反。
- 尽管 Erdős-Rényi(ER)分布理论上具有连接性优势,但在 RNN 中,均匀稀疏度分布的表现优于 ER 分布。
- 存在大量拓扑结构不同的低损失稀疏 RNN,表明有效稀疏架构的潜在空间极为丰富。
- SNT-ASGD 显著提升了所有稀疏训练方法在 RNN 中的性能,证明其作为通用优化器的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。