Skip to main content
QUICK REVIEW

[论文解读] Per-Tensor Fixed-Point Quantization of the Back-Propagation Algorithm

Charbel Sakr, Naresh R. Shanbhag|arXiv (Cornell University)|Dec 31, 2018
Tensor decomposition and applications参考文献 34被引用 9
一句话总结

本文提出了一种系统化、基于分析推导的逐张量定点量化方法,用于反向传播算法中所有组件——权重、激活值、梯度和权重累加器——的定点量化,实现了深度神经网络的完整定点训练。该方法在CIFAR-10、CIFAR-100和SVHN基准测试中,以每层接近最小精度实现,同时将全精度训练准确率损失控制在0.56%以内,计算、表示和通信成本分别降低至原来的1/8、1/6和1/4。

ABSTRACT

The high computational and parameter complexity of neural networks makes their training very slow and difficult to deploy on energy and storage-constrained computing systems. Many network complexity reduction techniques have been proposed including fixed-point implementation. However, a systematic approach for designing full fixed-point training and inference of deep neural networks remains elusive. We describe a precision assignment methodology for neural network training in which all network parameters, i.e., activations and weights in the feedforward path, gradients and weight accumulators in the feedback path, are assigned close to minimal precision. The precision assignment is derived analytically and enables tracking the convergence behavior of the full precision training, known to converge a priori. Thus, our work leads to a systematic methodology of determining suitable precision for fixed-point training. The near optimality (minimality) of the resulting precision assignment is validated empirically for four networks on the CIFAR-10, CIFAR-100, and SVHN datasets. The complexity reduction arising from our approach is compared with other fixed-point neural network designs.

研究动机与目标

  • 通过使网络所有组件——权重、激活值、梯度和累加器——均能进行定点数运算,弥合深度神经网络真正定点训练的差距。
  • 解决定点反向传播中量化噪声、动态范围不确定性、相互依赖的精度权衡以及训练不稳定性等挑战。
  • 开发一种基于分析的精度分配策略,确保与全精度训练具有统计相似性。
  • 证明即使在梯度动态范围事先未知的情况下,完整定点训练在可行性与效率上均是可行的。
  • 通过与理论最小值及现有定点设计对比,验证所分配精度的近似最优性。

提出的方法

  • 该方法基于网络张量的统计特性(包括梯度的空间方差和平方雅可比矩阵的奇异值)进行逐层精度需求的解析推导。
  • 采用精度动态范围(PDR)模型,根据量化误差界限估算每类张量所需的位数。
  • 利用基准全精度网络来获取动态范围与误差特性,实现在无需微调的情况下完成精度分配。
  • 基于雅可比矩阵的最大奇异值和梯度张量的方差计算量化步长,以控制量化噪声。
  • 为每层的每一类张量(权重、激活值、权重梯度、激活梯度、权重累加器)分别分配独立的位宽。
  • 通过在CIFAR-10、CIFAR-100和SVHN上的实证评估验证精度分配策略,确保训练收敛与准确率保真度。

实验结果

研究问题

  • RQ1是否能够对反向传播算法的所有组件——权重、激活值、梯度和累加器——进行定点数运算,而不会牺牲训练收敛性或准确率?
  • RQ2为每类张量在每层所需的最小位宽是多少,才能保持与全精度训练的统计相似性?
  • RQ3在不同网络架构中(尤其是残差网络),精度需求如何随层的变化而变化?
  • RQ4该方法是否能在梯度动态范围未知的情况下,实现接近最小精度,同时保持训练稳定性和准确率?
  • RQ5与现有定点训练和量化训练方法相比,所提出的定点训练在效率和准确率方面表现如何?

主要发现

  • 所提方法在所有测试基准(CIFAR-10、CIFAR-100、SVHN)上实现完整定点训练,与全精度训练相比准确率损失小于0.56%。
  • 精度分配结果在每类张量上仅比理论最小值多1位,证明了位宽分配的近似最优性。
  • 权重精度从输入层到输出层逐渐降低,而激活梯度与权重累加器的精度则在深层逐渐增加。
  • 残差网络在各层表现出均匀的精度需求,表明其在量化敏感性方面具有架构不变性。
  • 与全精度训练及先前的定点设计相比,该方法将计算成本降低最多8倍、表示成本降低最多6倍、通信成本降低最多4倍。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。