Skip to main content
QUICK REVIEW

[论文解读] Neural gradients are near-lognormal: improved quantized and sparse training

Brian Chmiel, Liad Ben-Uri|arXiv (Cornell University)|Jun 15, 2020
Advanced Neural Network Applications被引用 9
一句话总结

本文发现神经梯度近似服从对数正态分布,从而提出两种新型分析方法:优化的6位浮点量化与精确的梯度稀疏性剪枝。通过利用对数正态统计特性,作者在ImageNet上实现了6位梯度量化与高达85%的稀疏性,且无精度损失,达到SOTA性能,为基于启发式方法(如损失缩放)提供了理论基础明确的替代方案。

ABSTRACT

While training can mostly be accelerated by reducing the time needed to propagate neural gradients back throughout the model, most previous works focus on the quantization/pruning of weights and activations. These methods are often not applicable to neural gradients, which have very different statistical properties. Distinguished from weights and activations, we find that the distribution of neural gradients is approximately lognormal. Considering this, we suggest two closed-form analytical methods to reduce the computational and memory burdens of neural gradients. The first method optimizes the floating-point format and scale of the gradients. The second method accurately sets sparsity thresholds for gradient pruning. Each method achieves state-of-the-art results on ImageNet. To the best of our knowledge, this paper is the first to (1) quantize the gradients to 6-bit floating-point formats, or (2) achieve up to 85% gradient sparsity -- in each case without accuracy degradation. Reference implementation accompanies the paper.

研究动机与目标

  • 为解决训练过程中反向传播神经梯度带来的计算与内存开销问题。
  • 克服现有量化与剪枝方法的局限性,这些方法假设梯度服从高斯或拉普拉斯分布,但由于梯度具有重尾特性而失效。
  • 基于梯度幅值实际服从对数正态分布的实证观察,提出理论基础扎实、闭式表达的梯度量化与剪枝方法。
  • 在ImageNet上实现量化训练与稀疏训练的SOTA性能,且无精度损失。

提出的方法

  • 作者通过统计检验将梯度幅值的分布建模为对数正态分布,表明其拟合效果优于高斯或拉普拉斯分布。
  • 推导出低精度浮点格式(如FP6、FP7)中指数与尾数位宽最优分配的闭式表达式,以最小化量化噪声。
  • 提出一种方法,基于对数正态参数精确计算随机梯度剪枝的阈值,实现对稀疏度水平的精确控制。
  • 引入异质稀疏性,即根据不同层的对数正态参数为其分配不同的稀疏度水平,以保持余弦相似性与模型精度。
  • 采用截断对数正态模型,分析计算梯度间余弦相似性,考虑极端值对相似性度量的影响。
  • 在ResNet18上使用ImageNet与CIFAR-10验证其方法,与基线方法及启发式方法(如损失缩放与top-k剪枝)进行对比。

实验结果

研究问题

  • RQ1哪种统计分布最能描述反向传播过程中神经梯度幅值的特性?
  • RQ2能否基于梯度分布,推导出低精度浮点表示梯度的闭式分析方法以实现优化?
  • RQ3能否基于梯度分布推导出的理论阈值,实现高精度的梯度稀疏性设置?
  • RQ4与均匀稀疏性相比,按层调整稀疏度的异质稀疏性在精度与余弦相似性方面表现如何?
  • RQ5所提方法能否在不造成精度损失的前提下,实现量化与稀疏训练的SOTA性能?

主要发现

  • 神经梯度幅值最适宜由对数正态分布建模,统计检验结果(拟合优度检验)提供强有力证据。
  • 作者在ImageNet上实现了6位浮点量化梯度,且无精度损失,创下新SOTA纪录。
  • 通过理论推导的剪枝阈值,实现了高达85%的梯度稀疏性,且无精度下降,同样创下新SOTA纪录。
  • 异质稀疏性(基于对数正态参数为各层独立调节稀疏度)在整体稀疏度达92%时,精度损失低于1%,优于同质稀疏性。
  • 与top-k + 随机剪枝相比,其分析剪枝方法在不同层间保持了更稳定的余弦相似性,偏差更小。
  • 该方法为损失缩放提供了理论基础,将原本依赖启发式调参的缩放因子,替换为基于对数正态参数推导出的分析式缩放因子。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。