Skip to main content
QUICK REVIEW

[论文解读] Selfish Sparse RNN Training

Shiwei Liu, Decebal Constantin Mocanu|arXiv (Cornell University)|Jan 22, 2021
Advanced Neural Network Applications参考文献 57被引用 12
一句话总结

本文提出 Selfish-RNN,一种从零开始训练稀疏循环神经网络(RNN)的方法,采用固定参数数量,结合一种新型稀疏优化器(SNT-ASGD)和非均匀的门控权重重分配策略,以提升正则化效果。该方法在 Penn TreeBank 和 Wikitext-2 数据集上实现了最先进性能,优于 RNN 设置下的密集模型剪枝方法。

ABSTRACT

Sparse neural networks have been widely applied to reduce the computational demands of training and deploying over-parameterized deep neural networks. For inference acceleration, methods that discover a sparse network from a pre-trained dense network (dense-to-sparse training) work effectively. Recently, dynamic sparse training (DST) has been proposed to train sparse neural networks without pre-training a dense model (sparse-to-sparse training), so that the training process can also be accelerated. However, previous sparse-to-sparse methods mainly focus on Multilayer Perceptron Networks (MLPs) and Convolutional Neural Networks (CNNs), failing to match the performance of dense-to-sparse methods in the Recurrent Neural Networks (RNNs) setting. In this paper, we propose an approach to train intrinsically sparse RNNs with a fixed parameter count in one single run, without compromising performance. During training, we allow RNN layers to have a non-uniform redistribution across cell gates for better regularization. Further, we propose SNT-ASGD, a novel variant of the averaged stochastic gradient optimizer, which significantly improves the performance of all sparse training methods for RNNs. Using these strategies, we achieve state-of-the-art sparse training results, better than the dense-to-sparse methods, with various types of RNNs on Penn TreeBank and Wikitext-2 datasets. Our codes are available at https://github.com/Shiweiliuiiiiiii/Selfish-RNN.

研究动机与目标

  • 为解决现有动态稀疏训练(DST)方法在 RNN 中表现不佳的问题,这些方法的性能落后于密集到稀疏的方法。
  • 实现从零开始的端到端稀疏 RNN 训练,且参数数量固定,避免对密集模型进行预训练。
  • 通过在 LSTM 单元门控之间非均匀地重新分配权重,提升稀疏 RNN 的泛化能力和性能。
  • 开发一种新型优化器 SNT-ASGD,适用于稀疏训练,可提升各类 RNN 架构的收敛性和性能。
  • 分析稀疏连接的拓扑结构,揭示 RNN 中权重增长与稀疏性分布的反直觉发现。

提出的方法

  • 提出 SNT-ASGD,一种带有非单调平均的稀疏平均随机梯度下降变体,专为稀疏 RNN 训练而设计。
  • 在训练过程中,对 LSTM 单元的各个门控(输入、遗忘、细胞、输出)实施非均匀的权重重分配,以增强正则化效果。
  • 在整个训练过程中保持固定的稀疏度,避免迭代式的剪枝或增长阶段。
  • 采用图论度量方法,量化不同稀疏连接模式之间的拓扑距离。
  • 采用反向传播机制,跳过零权重参数的计算,从而减少 FLOPs,且无需存储不存在的梯度。
  • 在 RNN 中评估了多种稀疏度分布(均匀分布、Erdős-Rényi 分布、ERK)和权重增长策略(随机 vs. 基于梯度)的影响。

实验结果

研究问题

  • RQ1动态稀疏训练能否在 RNN 中实现与密集到稀疏方法相当的最先进性能?
  • RQ2在 LSTM 单元门控之间非均匀地重新分配权重,是否能提升泛化能力和模型性能?
  • RQ3稀疏度分布的选择(均匀分布 vs. Erdős-Rényi 分布)如何影响稀疏 RNN 的性能?
  • RQ4为何在稀疏 RNN 训练中,基于随机的权重增长策略优于基于梯度的策略?
  • RQ5低损失稀疏 RNN 架构的拓扑多样性如何?它们之间有何不同?

主要发现

  • Selfish-RNN 在 Penn TreeBank 和 Wikitext-2 上实现了最先进性能,优于密集到稀疏剪枝方法以及现有的 DST 方法。
  • 在所有 RNN 模型中,遗忘门的权重始终最稀疏,而细胞门和输出门的权重则比平均值更密集。
  • 在稀疏 RNN 训练中,基于随机的权重增长优于基于梯度的增长策略,这与卷积神经网络(CNNs)和多层感知机(MLPs)中的发现相反。
  • 尽管 Erdős-Rényi(ER)分布理论上具有连接性优势,但在 RNN 中,均匀稀疏度分布的表现优于 ER 分布。
  • 存在大量拓扑结构不同的低损失稀疏 RNN,表明有效稀疏架构的潜在空间极为丰富。
  • SNT-ASGD 显著提升了所有稀疏训练方法在 RNN 中的性能,证明其作为通用优化器的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。