Skip to main content
QUICK REVIEW

[论文解读] Structurally Sparsified Backward Propagation for Faster Long Short-Term Memory Training

Maohua Zhu, Jason Clemons|arXiv (Cornell University)|Jun 1, 2018
Advanced Neural Network Applications参考文献 15被引用 7
一句话总结

本文提出一种面向长短期记忆(LSTM)网络的结构化稀疏反向传播方法,在反向传播过程中对门梯度施加固定稀疏性,以加速GPU上的训练。通过在LSTM门梯度上应用粗粒度或细粒度的结构化稀疏性,该方法相比密集训练可实现高达45%的反向传播加速,相比最先进稀疏化方法快168%,且在结合短暂密集训练阶段后仅造成极小的精度损失。

ABSTRACT

Exploiting sparsity enables hardware systems to run neural networks faster and more energy-efficiently. However, most prior sparsity-centric optimization techniques only accelerate the forward pass of neural networks and usually require an even longer training process with iterative pruning and retraining. We observe that artificially inducing sparsity in the gradients of the gates in an LSTM cell has little impact on the training quality. Further, we can enforce structured sparsity in the gate gradients to make the LSTM backward pass up to 45% faster than the state-of-the-art dense approach and 168% faster than the state-of-the-art sparsifying method on modern GPUs. Though the structured sparsifying method can impact the accuracy of a model, this performance gap can be eliminated by mixing our sparse training method and the standard dense training method. Experimental results show that the mixed method can achieve comparable results in a shorter time span than using purely dense training.

研究动机与目标

  • 通过利用反向传播中尚未被充分优化的稀疏性,加速LSTM训练。
  • 解决现有梯度稀疏化方法在现代GPU上效率低下的问题,这些方法因稀疏矩阵乘法开销过高而表现不佳。
  • 通过将稀疏训练与周期性密集微调相结合,在不牺牲模型精度的前提下实现显著加速。
  • 设计硬件感知的稀疏模式,以利用GPU优化的矩阵运算实现最大性能提升。
  • 证明在门梯度中采用适度稀疏性(例如50%)对训练质量影响极小,尤其在结合密集阶段时更为显著。

提出的方法

  • 提出两种结构化稀疏化方法——粗粒度和细粒度——针对反向传播过程中LSTM门的梯度。
  • 通过仅保留门梯度中绝对值最大的k个值,施加固定的稀疏度水平(例如50%),并在每个门上强制实现结构化稀疏性。
  • 设计稀疏化方法以兼容高性能GPU内核,避免昂贵的全局top-k操作。
  • 引入一种混合训练策略:大多数训练步骤使用稀疏化梯度,随后通过少量密集步骤恢复精度。
  • 采用混合训练调度(例如3/4稀疏 + 1/4密集)以平衡速度与模型质量,最小化性能下降。
  • 使用标准SGD配合稀疏化梯度,确保与现有深度学习框架和训练流水线的兼容性。

实验结果

研究问题

  • RQ1在LSTM门梯度中采用结构化稀疏性是否能显著加速反向传播,同时不降低模型精度?
  • RQ2在现代GPU上,结构化梯度稀疏化方法的性能与密集训练及现有稀疏化方法相比如何?
  • RQ3在保持可接受模型性能的前提下,稀疏度水平与训练速度之间的最优权衡是什么?
  • RQ4能否通过短暂的密集训练阶段有效弥补稀疏训练带来的精度差距?
  • RQ5所提出方法是否可在不同NLP任务和模型架构(如神经机器翻译和语言建模)中实现可扩展性?

主要发现

  • 粗粒度稀疏化方法在现代GPU上相比密集训练,使LSTM反向传播速度提升45%。
  • 在50%稀疏度下,该方法比最先进稀疏化方法(meProp)快168%,尽管meProp具有更高的精度。
  • 在50%稀疏度下,粗粒度方法相比密集训练仅导致BLEU分数下降3.5%,且通过1/4的密集阶段可完全恢复该差距。
  • 混合稀疏-密集训练策略在更短时间内实现了与密集训练(BLEU 20.32)相当的BLEU分数(20.30–20.45)。
  • 细粒度方法实现了36%的加速,且精度略优于粗粒度方法,但因内核开销较高而效率较低。
  • 加速效果与应用类型无关,对基于LSTM的任务(如机器翻译、语言建模和图像字幕生成)均具有统一适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。