Skip to main content
QUICK REVIEW

[论文解读] Accelerating CNN Training by Pruning Activation Gradients

Xucheng Ye, Pengcheng Dai|arXiv (Cornell University)|Aug 1, 2019
Advanced Neural Network Applications参考文献 33被引用 8
一句话总结

本文提出一种动态梯度剪枝方法,通过在反向传播过程中稀疏剪枝激活梯度来加速CNN训练。通过将梯度建模为正态分布并基于方差设定阈值进行随机剪枝,该方法在ARM CPU上实现了高达5.92倍的加速,且在CIFAR-10/100和ImageNet上的ResNet与AlexNet模型中精度损失可忽略不计。

ABSTRACT

Sparsification is an efficient approach to accelerate CNN inference, but it is challenging to take advantage of sparsity in training procedure because the involved gradients are dynamically changed. Actually, an important observation shows that most of the activation gradients in back-propagation are very close to zero and only have a tiny impact on weight-updating. Hence, we consider pruning these very small gradients randomly to accelerate CNN training according to the statistical distribution of activation gradients. Meanwhile, we theoretically analyze the impact of pruning algorithm on the convergence. The proposed approach is evaluated on AlexNet and ResNet-\{18, 34, 50, 101, 152\} with CIFAR-\{10, 100\} and ImageNet datasets. Experimental results show that our training approach could substantially achieve up to $5.92 imes$ speedups at back-propagation stage with negligible accuracy loss.

研究动机与目标

  • 通过在反向传播过程中利用激活梯度中的稀疏性,减少深度CNN的训练时间。
  • 解决动态梯度更新带来的稀疏性利用障碍问题。
  • 实现在CPU和边缘设备等低资源平台上的高效训练。
  • 在显著加速反向传播的同时保持模型收敛性和精度。

提出的方法

  • 假设激活梯度服从正态分布,并从其平均绝对值估计方差。
  • 基于方差和用户定义的稀疏率p推导剪枝阈值τ。
  • 应用随机剪枝:将低于τ的梯度随机置零或设为±τ,以保持梯度流。
  • 支持Conv-ReLU和Conv-BN-ReLU网络架构,包括ResNet和AlexNet。
  • 通过统计分析证明在剪枝下具有收敛稳定性。
  • 使用BLAS优化内核在Intel和ARM CPU上实现并评估该方法。

实验结果

研究问题

  • RQ1在反向传播过程中,是否可以有效剪枝CNN中的激活梯度而不损害模型收敛性或精度?
  • RQ2如何基于数据驱动和统计基础推导出指导动态变化梯度剪枝的阈值?
  • RQ3对ResNet和AlexNet等深层网络,小梯度的随机剪枝是否能保持优化轨迹?
  • RQ4在ARM等低功耗平台上的可实现加速比是多少?
  • RQ5与先前工作相比,该方法在大规模数据集上的稀疏性、精度和加速性能如何?

主要发现

  • 该方法在ARM CPU上对AlexNet训练实现了高达5.92倍的加速,且精度损失可忽略不计。
  • 在Intel CPU上,该方法在ResNet和AlexNet模型上实现了1.71倍至3.99倍的加速。
  • 该方法保持了收敛稳定性,在CIFAR-10和ImageNet数据集上的训练损失曲线影响极小。
  • 在ResNet-18上,稀疏度达到70%–90%(ρnnz ≈ 0.16),99%剪枝时优于MSBP在稀疏性和精度方面的表现。
  • 该方法在不同网络架构上均表现稳健,包括Conv-ReLU和Conv-BN-ReLU模块。
  • 在单线程和多线程执行下均保持一致的加速效果,四线程ARM执行下加速比为1.79倍至2.78倍。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。