Skip to main content
QUICK REVIEW

[论文解读] Quantization and Training of Low Bit-Width Convolutional Neural Networks for Object Detection

Penghang Yin, Shuai Zhang|arXiv (Cornell University)|Dec 19, 2016
Advanced Neural Network Applications参考文献 15被引用 15
一句话总结

本文提出LBW-Net,一种基于优化的方法,用于训练权重被量化为零或2的幂次的低比特宽度(例如6比特)卷积神经网络。通过针对2比特网络精确求解最小二乘量化问题,并针对更高比特宽度采用仅含一个可调参数的半解析阈值化方案,LBW-Net在PASCAL VOC目标检测任务上实现了近乎无损的准确率,同时实现了超过4倍的推理加速以及显著的内存与能效节省。

ABSTRACT

We present LBW-Net, an efficient optimization based method for quantization and training of the low bit-width convolutional neural networks (CNNs). Specifically, we quantize the weights to zero or powers of two by minimizing the Euclidean distance between full-precision weights and quantized weights during backpropagation. We characterize the combinatorial nature of the low bit-width quantization problem. For 2-bit (ternary) CNNs, the quantization of $N$ weights can be done by an exact formula in $O(N\log N)$ complexity. When the bit-width is three and above, we further propose a semi-analytical thresholding scheme with a single free parameter for quantization that is computationally inexpensive. The free parameter is further determined by network retraining and object detection tests. LBW-Net has several desirable advantages over full-precision CNNs, including considerable memory savings, energy efficiency, and faster deployment. Our experiments on PASCAL VOC dataset show that compared with its 32-bit floating-point counterpart, the performance of the 6-bit LBW-Net is nearly lossless in the object detection tasks, and can even do better in some real world visual scenes, while empirically enjoying more than 4$ imes$ faster deployment.

研究动机与目标

  • 为解决在移动电话等资源受限设备上部署大型高精度CNN的挑战。
  • 开发一种高效、精确且可扩展的低比特宽度CNN量化方法,以保持模型准确率。
  • 在最大化计算效率与内存节省的同时,最小化权重量化引起的准确率下降。
  • 通过网络微调与目标检测性能评估,而非仅依赖最小二乘误差,来确定最优量化参数。

提出的方法

  • 该方法在反向传播过程中通过最小化全精度权重与量化权重之间的欧氏距离,将全精度权重量化为零或2的幂次。
  • 对于2比特(三值)网络,采用基于排序的方法在O(N log N)时间内精确计算最优量化。
  • 对于比特宽度≥3的情况,引入一种半解析阈值化方案,仅含一个自由参数μ以定义量化级别。
  • 缩放因子s通过μ与每层中排序后权重幅值的分布关系,进行解析推导。
  • 参数μ通过网络微调与目标检测性能评估进行调优,而非仅依赖近似误差。
  • 采用一种改进的投影随机梯度下降方法进行微调,每轮训练迭代中增加一个低成本的阈值化步骤以强制执行量化。

实验结果

研究问题

  • RQ1能否在最小二乘意义下,为全精度权重推导出低比特宽度量化问题的精确解?
  • RQ2如何有效应对大规模CNN中更高比特宽度(≥3比特)量化带来的组合复杂性?
  • RQ3在半解析量化方案中,自由参数μ的最优值是多少,才能实现高检测准确率?
  • RQ4低比特宽度网络(如6比特)在目标检测任务中,能在多大程度上匹配全精度模型的性能?
  • RQ5使用零或2的幂次权重进行量化推理,是否能显著提升部署速度与效率?

主要发现

  • 6比特LBW-Net在PASCAL VOC数据集上的目标检测性能与32比特浮点模型相比,差距在1%以内。
  • 对于2比特网络,精确量化解可在O(N log N)时间内计算,支持高效优化。
  • 对于比特宽度≥4的情况,通过实验发现最优参数μ为μ = (3/4) × ||W^f||_∞,该设置优先保证大权重幅值的精确编码。
  • 由于将浮点乘法替换为位移操作,LBW-Net的部署速度相比全精度模型提升了4倍以上。
  • 在真实视觉场景中,6比特LBW-Net甚至优于全精度模型,表明其对复杂特征具有更强的鲁棒性。
  • 该方法支持从零开始训练或部分热启动训练,且微调能有效吸收量化引入的误差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。