[论文解读] Post-Training Piecewise Linear Quantization for Deep Neural Networks
本文提出后训练分段线性量化(PWLQ),一种通过将张量值范围划分为非重叠区域并为每个区域分配相等的量化级别,以最小化量化误差来优化断点的低比特后训练量化方法。PWLQ在4比特及以下的图像分类、语义分割和目标检测任务中均达到最先进性能,显著优于均匀量化,且硬件开销极低。
Quantization plays an important role in the energy-efficient deployment of deep neural networks on resource-limited devices. Post-training quantization is highly desirable since it does not require retraining or access to the full training dataset. The well-established uniform scheme for post-training quantization achieves satisfactory results by converting neural networks from full-precision to 8-bit fixed-point integers. However, it suffers from significant performance degradation when quantizing to lower bit-widths. In this paper, we propose a piecewise linear quantization (PWLQ) scheme to enable accurate approximation for tensor values that have bell-shaped distributions with long tails. Our approach breaks the entire quantization range into non-overlapping regions for each tensor, with each region being assigned an equal number of quantization levels. Optimal breakpoints that divide the entire range are found by minimizing the quantization error. Compared to state-of-the-art post-training quantization methods, experimental results show that our proposed method achieves superior performance on image classification, semantic segmentation, and object detection with minor overhead.
研究动机与目标
- 为解决低比特宽度(如4比特)下后训练量化导致的性能下降问题,特别是针对具有钟形权重和激活分布的模型。
- 开发一种无需微调或访问完整训练数据即可保持高精度的量化方案。
- 设计一种硬件友好的方法,避免复杂变换或查表操作,同时实现比均匀量化更丰富的表示能力。
- 在包括分类、分割和目标检测在内的多样化计算机视觉任务中评估所提方法。
提出的方法
- 该方法将每个张量(权重或激活)的完整范围划分为非重叠区域,每个区域分配相等数量的量化级别。
- 利用分段线性逼近来建模张量值的分布,尤其适用于具有长尾的钟形分布。
- 通过数值优化计算量化误差,确定区域之间的最优断点。
- 该方法支持逐层或逐通道量化,并集成偏差校正以进一步提升精度。
- 通过避免对数变换或基于聚类的查表操作,保持硬件效率,实现在仅支持整数运算的硬件上的快速推理。
- 该方法在训练后应用,无需微调或访问原始训练数据集。
实验结果
研究问题
- RQ1分段线性量化方案是否能比均匀量化更有效地降低低比特后训练量化中的量化误差?
- RQ2在4比特及以下条件下,PWLQ在具有长尾钟形权重和激活分布的模型上表现如何?
- RQ3最优断点选择对不同视觉任务中量化精度和模型性能的影响如何?
- RQ4与最先进后训练量化方法(如DFQ)相比,PWLQ在精度和硬件效率方面表现如何?
- RQ5PWLQ能否在无需微调的情况下有效应用于语义分割和目标检测等多样化计算机视觉任务?
主要发现
- 在ImageNet分类任务中,4比特PWLQ在ResNet-50上达到74.98%的top-1准确率,比4比特均匀量化高出2.56%。
- 在DeepLab-v3+的语义分割任务中,4比特PWLQ达到67.66%的mIoU,较4比特均匀量化提升17.61%。
- 在SSD-Lite的目标检测任务中,4比特PWLQ的精度下降仅0.38%,而均匀量化下降达3.91%。
- 使用6比特权重的PWLQ在DeepLab-v3+上达到70.39%的mIoU,优于8比特DFQ的72.33%。
- 该方法在所有评估任务中均达到最先进性能,计算开销极低,展现出强大的泛化能力和硬件兼容性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。