Skip to main content
QUICK REVIEW

[论文解读] Training High-Performance and Large-Scale Deep Neural Networks with Full 8-bit Integers

Yukuan Yang, Shuang Wu|arXiv (Cornell University)|Sep 5, 2019
Advanced Neural Network Applications参考文献 34被引用 11
一句话总结

该论文提出WAGEUBN,这是首个针对大规模深度神经网络训练的完整8位整数量化框架,实现了所有数据路径(包括权重、激活值、梯度、误差、更新、批量归一化和动量优化器)的全整数运算。与FP32相比,该方法在实现高达4倍内存减少、9倍计算加速和30倍以上功耗降低的同时,仍能保持与ImageNet相当的准确率,从而在便携设备上实现高效的在线学习。

ABSTRACT

Deep neural network (DNN) quantization converting floating-point (FP) data in the network to integers (INT) is an effective way to shrink the model size for memory saving and simplify the operations for compute acceleration. Recently, researches on DNN quantization develop from inference to training, laying a foundation for the online training on accelerators. However, existing schemes leaving batch normalization (BN) untouched during training are mostly incomplete quantization that still adopts high precision FP in some parts of the data paths. Currently, there is no solution that can use only low bit-width INT data during the whole training process of large-scale DNNs with acceptable accuracy. In this work, through decomposing all the computation steps in DNNs and fusing three special quantization functions to satisfy the different precision requirements, we propose a unified complete quantization framework termed as ``WAGEUBN'' to quantize DNNs involving all data paths including W (Weights), A (Activation), G (Gradient), E (Error), U (Update), and BN. Moreover, the Momentum optimizer is also quantized to realize a completely quantized framework. Experiments on ResNet18/34/50 models demonstrate that WAGEUBN can achieve competitive accuracy on the ImageNet dataset. For the first time, the study of quantization in large-scale DNNs is advanced to the full 8-bit INT level. In this way, all the operations in the training and inference can be bit-wise operations, pushing towards faster processing speed, decreased memory cost, and higher energy efficiency. Our throughout quantization framework has great potential for future efficient portable devices with online learning ability.

研究动机与目标

  • 为解决DNN训练中不完整的量化的挑战,即仅部分数据路径被量化的现象,或在批量归一化和优化器等关键组件中仍保留FP精度的问题。
  • 实现在整个训练流水线中(包括前向传播和反向传播、权重更新和优化)的完整8位整数计算,以提升硬件效率。
  • 通过引入基于标志位的量化方法,扩展动态范围并保留小数值信息,从而克服低精度训练中的非收敛问题。
  • 将量化扩展至ResNet18/34/50等大规模模型在ImageNet上的应用,证明在完整8位整数级别下实现可行性和高性能。
  • 提供面向硬件优化的框架,为未来具备在线学习能力的便携设备实现更快、更低功耗和更高效的内存使用训练。

提出的方法

  • 该框架将所有DNN计算步骤分解为独立的数据路径:W(权重)、A(激活值)、G(梯度)、E(误差)、U(更新)、BN(批量归一化)和O(优化器),每条路径独立进行量化。
  • 融合三种专用的量化函数以满足不同精度需求:标准8位量化、用于误差和梯度张量的标志位增强型8位量化,以及用于批量归一化的缩放整数表示。
  • 在误差和梯度张量的量化中引入标志位,以扩展有效动态范围,保留微小但具有信息量的数值,防止非收敛。
  • 将批量归一化层替换为可学习的缩放因子(INT8格式),消除对FP依赖,同时保持训练稳定性。
  • 将动量优化器完全量化为8位整数,使所有优化步骤均可通过位运算完成。
  • 在ResNet18/34/50上使用ImageNet对框架进行评估,实现端到端训练和推理均基于8位整数算术。

实验结果

研究问题

  • RQ1是否可以在整个DNN训练过程中(包括反向传播和优化)使用完整的8位整数算术,而不会牺牲模型准确率?
  • RQ2如何扩展低精度量化的动态范围,以防止非收敛,特别是针对小数值梯度和误差?
  • RQ3能否在不降低训练性能的前提下,有效用8位整数格式的量化、固定比例等效方法替代批量归一化?
  • RQ4与混合精度或FP32训练相比,完整8位整数量化训练在实际硬件效率方面(速度、功耗、面积)能带来多大提升?
  • RQ5该框架能否成功应用于ResNet50等大规模模型在ImageNet上的训练,同时保持具有竞争力的准确率?

主要发现

  • WAGEUBN在ImageNet上使用ResNet18实现了70.2%的顶级-1准确率,证明了大规模模型全8位整数量化训练的可行性。
  • 与全精度FP32网络相比,该框架将模型大小减少了约4倍,显著降低了内存需求。
  • 与FP32相比,WAGEUBN中的乘法和累加运算分别实现了超过3倍和9倍的加速,功耗降低超过30倍。
  • 标志位量化方法提高了小数值梯度和误差的数据覆盖比例,防止非收敛并提升训练稳定性。
  • FPGA上的硬件仿真显示,INT8运算相比FP32在乘法操作中实现面积减少9倍、功耗降低10倍、速度提升3倍;在累加操作中实现功耗降低30倍、速度提升9倍。
  • 本工作首次建立了针对大规模DNN的完整8位整数量化训练框架,实现了所有训练组件的位运算,为高效设备端在线学习铺平了道路。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。