Skip to main content
QUICK REVIEW

[论文解读] VS-Quant: Per-vector Scaled Quantization for Accurate Low-Precision Neural Network Inference

Steve Dai, Rangharajan Venkatesan|arXiv (Cornell University)|Feb 8, 2021
Advanced Neural Network Applications参考文献 28被引用 13
一句话总结

VS-Quant 引入了逐向量缩放量化,通过在张量内对小向量(16–64 个元素)使用独立的缩放因子,减少量化误差并提升低精度推理的准确性。在 ResNet50 上,使用 4 位权重和激活时,VS-Quant 实现了 37% 的面积节省和 24% 的能耗降低,同时保持超过 75% 的 ImageNet 准确率;在 BERT 模型上,使用 4 位权重和 8 位激活时,实现了 26% 的面积减少,同时保持接近全精度的性能。

ABSTRACT

Quantization enables efficient acceleration of deep neural networks by reducing model memory footprint and exploiting low-cost integer math hardware units. Quantization maps floating-point weights and activations in a trained model to low-bitwidth integer values using scale factors. Excessive quantization, reducing precision too aggressively, results in accuracy degradation. When scale factors are shared at a coarse granularity across many dimensions of each tensor, effective precision of individual elements within the tensor are limited. To reduce quantization-related accuracy loss, we propose using a separate scale factor for each small vector of ($\approx$16-64) elements within a single dimension of a tensor. To achieve an efficient hardware implementation, the per-vector scale factors can be implemented with low-bitwidth integers when calibrated using a two-level quantization scheme. We find that per-vector scaling consistently achieves better inference accuracy at low precision compared to conventional scaling techniques for popular neural networks without requiring retraining. We also modify a deep learning accelerator hardware design to study the area and energy overheads of per-vector scaling support. Our evaluation demonstrates that per-vector scaled quantization with 4-bit weights and activations achieves 37% area saving and 24% energy saving while maintaining over 75% accuracy for ResNet50 on ImageNet. 4-bit weights and 8-bit activations achieve near-full-precision accuracy for both BERT-base and BERT-large on SQuAD while reducing area by 26% compared to an 8-bit baseline.

研究动机与目标

  • 减少低精度神经网络推理中由量化引起的精度损失。
  • 实现对细粒度缩放因子的高效硬件支持,且不产生过度开销。
  • 在无需微调的情况下,提升如 ResNet50 和 BERT 等模型的后训练量化精度。
  • 评估 DNN 加速器设计中逐向量缩放带来的面积与能耗权衡。
  • 证明逐向量缩放相比传统的逐通道或逐层缩放,能实现更优的精度、能耗与面积效率。

提出的方法

  • 提出逐向量缩放量化(VS-Quant),其中张量内每个 16–64 个元素的小向量均拥有独立的缩放因子,从而减小每个向量的动态范围,最小化量化误差。
  • 引入两级量化方案,结合粗粒度与细粒度缩放因子,通过低位宽整数实现高效的硬件映射。
  • 修改 DNN 加速器以支持向量乘累加(MAC)单元中的动态逐向量缩放,与现有硬件单元对齐,实现最小开销。
  • 采用校准缩放因子的后训练量化(PTQ)以在不微调的情况下保持精度,同时支持量化感知训练(QAT)以进一步提升精度。
  • 在 QAT 中使用直通估计器(STE)实现通过量化器的梯度反向传播,而缩放因子不参与训练,仅在校准阶段确定。
  • 通过在修改后的加速器上进行面积与能耗建模,评估硬件影响,比较 4 位与 8 位精度配置。

实验结果

研究问题

  • RQ1与粗粒度的逐层或逐通道缩放相比,逐向量缩放是否能更有效地减少低精度 DNN 推理中的量化误差?
  • RQ2在 DNN 加速器中支持逐向量缩放的硬件面积与能耗开销是多少?
  • RQ3逐向量缩放如何影响如 ResNet50 和 BERT 等多样化模型的后训练量化精度?
  • RQ4与传统量化技术相比,逐向量缩放能否在更低的位宽下实现接近全精度的精度?
  • RQ5在使用逐向量缩放时,模型大小、精度与硬件效率之间的最优权衡是什么?

主要发现

  • 在 BERT-base 上,VS-Quant 使用 4 位权重和 8 位激活时,SQuAD 任务的准确率达到近全精度水平(87.80%),优于 8 位基线模型。
  • 在 ImageNet 上的 ResNet50 模型中,VS-Quant 使用 4 位权重和激活时,Top-1 准确率保持在 75% 以上,显著优于传统 4 位量化方法。
  • 与基线 8 位实现相比,支持逐向量缩放的硬件扩展实现了 37% 的面积减少和 24% 的能耗降低。
  • 在 BERT 模型上,使用 4 位权重和 8 位激活时,与 8 位基线相比实现了 26% 的面积减少,同时保持高精度。
  • 在低比特位宽(如 3–4 位)下,逐向量缩放相比逐通道缩放能实现更优的精度、能耗与面积权衡。
  • 使用 VS-Quant 的 QAT 在更少的训练周期内恢复精度(例如,BERT-large 在 3/8 位下仅需 2 个周期),而逐通道 QAT 则需多达 20 个周期。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。