Skip to main content
QUICK REVIEW

[论文解读] A Statistical Framework for Low-bitwidth Training of Deep Neural Networks

Jianfei Chen, Yu Gai|arXiv (Cornell University)|Oct 27, 2020
Advanced Neural Network Applications参考文献 39被引用 14
一句话总结

本文提出了一种统计框架,将低比特训练梯度建模为全精度梯度的无偏随机估计器,从而实现对梯度量化方差的理论分析。该框架提出了两种新型量化器——逐样本量化器(Per-Sample Quantizer, PSQ)和分块豪斯多夫量化器(Block Householder Quantizer, BHQ),有效降低了梯度方差,在ImageNet上实现了5-bit ResNet-50验证准确率与全精度训练相差仅0.5%,达到8-bit基线水平。

ABSTRACT

Fully quantized training (FQT), which uses low-bitwidth hardware by quantizing the activations, weights, and gradients of a neural network model, is a promising approach to accelerate the training of deep neural networks. One major challenge with FQT is the lack of theoretical understanding, in particular of how gradient quantization impacts convergence properties. In this paper, we address this problem by presenting a statistical framework for analyzing FQT algorithms. We view the quantized gradient of FQT as a stochastic estimator of its full precision counterpart, a procedure known as quantization-aware training (QAT). We show that the FQT gradient is an unbiased estimator of the QAT gradient, and we discuss the impact of gradient quantization on its variance. Inspired by these theoretical results, we develop two novel gradient quantizers, and we show that these have smaller variance than the existing per-tensor quantizer. For training ResNet-50 on ImageNet, our 5-bit block Householder quantizer achieves only 0.5% validation accuracy loss relative to QAT, comparable to the existing INT8 baseline.

研究动机与目标

  • 为解决全量化训练(FQT)中理论理解的缺乏,特别是梯度量化对收敛性的影响。
  • 将FQT梯度建模为全精度梯度的随机估计器,从而支持偏差与方差分析。
  • 设计新型梯度量化器,相比现有逐张量量化器,能更有效地降低方差。
  • 证明5-bit量化可实现与8-bit训练在ResNet-50上相当的性能。
  • 通过最小化精度损失,实现边缘设备上高效、低比特宽训练。

提出的方法

  • 将FQT形式化为QAT梯度的随机估计器,假设前向传播确定且量化无偏。
  • 推导FQT梯度的一般方差公式,揭示比特宽度与量化器类型对梯度质量的影响。
  • 提出逐样本量化器(PSQ),通过按梯度样本自适应调整量化策略以降低方差。
  • 引入分块豪斯多夫量化器(BHQ),通过正交变换将信号分布至梯度各维,缓解动态范围问题。
  • 利用偏差与方差的理论界指导低方差量化器的设计。
  • 在ImageNet(ResNet-50)和机器翻译(IWSLT14)上端到端评估量化器,比较梯度方差与验证准确率。

实验结果

研究问题

  • RQ1FQT中的梯度量化如何影响训练更新的偏差与方差?
  • RQ2能否在不依赖单层或凸性等强假设的前提下,构建用于分析FQT的统计框架?
  • RQ3不同量化器设计(如逐张量与逐样本)如何影响梯度方差与收敛性?
  • RQ45-bit梯度量化能否实现与8-bit或全精度训练相当的性能?
  • RQ5如BHQ与PSQ等新型量化器是否能比现有逐张量量化器更有效地降低方差?

主要发现

  • FQT梯度是QAT梯度的无偏估计器,在学习率趋于零时可保证渐近收敛等价性。
  • 所提出的分块豪斯多夫量化器(BHQ)显著降低了梯度方差,使5-bit训练在ImageNet上仅损失0.5%准确率。
  • 在ImageNet上的ResNet-50上,5-bit BHQ达到76.83%的验证准确率,与8-bit PTQ(77.40%)相当,接近QAT基线(77.35%)。
  • PSQ与BHQ的梯度方差均低于基线逐张量量化器(PTQ),尤其在低比特宽度下优势明显。
  • 在机器翻译(IWSLT14)任务中,5-bit BHQ的BLEU分数与QAT相差不足1%,而PTQ在5-bit时发散,展现出更强鲁棒性。
  • 该框架支持基于理论的低比特宽量化器设计,具备按层自适应比特宽度或新型格式的潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。