[论文解读] Learnable Companding Quantization for Accurate Low-bit Neural Networks
该论文提出了一种新型非均匀量化方法——可学习压缩量化(Learnable Companding Quantization, LCQ),通过联合优化可学习压缩函数与截断参数,最小化2、3和4比特神经网络中的量化误差。LCQ在准确率方面达到当前最优水平,其中ImageNet上的2比特ResNet-50模型达到75.1%的top-1准确率,与全精度模型的准确率差距仅1.7%。
Quantizing deep neural networks is an effective method for reducing memory consumption and improving inference speed, and is thus useful for implementation in resource-constrained devices. However, it is still hard for extremely low-bit models to achieve accuracy comparable with that of full-precision models. To address this issue, we propose learnable companding quantization (LCQ) as a novel non-uniform quantization method for 2-, 3-, and 4-bit models. LCQ jointly optimizes model weights and learnable companding functions that can flexibly and non-uniformly control the quantization levels of weights and activations. We also present a new weight normalization technique that allows more stable training for quantization. Experimental results show that LCQ outperforms conventional state-of-the-art methods and narrows the gap between quantized and full-precision models for image classification and object detection tasks. Notably, the 2-bit ResNet-50 model on ImageNet achieves top-1 accuracy of 75.1% and reduces the gap to 1.7%, allowing LCQ to further exploit the potential of non-uniform quantization.
研究动机与目标
- 解决与全精度模型相比,极低比特(2、3、4比特)神经网络中显著的准确率下降问题。
- 通过可学习压缩函数实现灵活的非均匀量化级别控制,以提升量化准确率。
- 通过一种新型权重归一化技术,稳定量化网络的训练过程。
- 通过优化查找表(LUT)大小,降低推理时的内存开销,同时不牺牲性能。
提出的方法
- LCQ提出一种可学习的分段线性压缩函数,对权重和激活值进行非线性压缩与扩展,以实现非均匀量化。
- 利用带有直通估计器(STE)的反向传播,联合优化压缩函数、截断阈值与网络权重。
- 提出一种新型归一化技术——有限权重归一化(Limited Weight Normalization, LWN),通过恢复量化权重的标准差,提升训练稳定性和准确率。
- 采用重量化技术,降低查找表(LUT)的外层位宽,从而最小化内存成本,实现高效推理。
- 压缩函数通过一组可学习参数Θ进行参数化,使量化级别分布能够根据数据分布灵活且自适应地调整。
- 该方法集成了截断、压缩、舍入与扩展的复合函数,其中非线性压缩与扩展部分联合训练。
实验结果
研究问题
- RQ1可学习的非均匀量化是否能显著缩小低比特与全精度模型在图像分类与目标检测任务中的准确率差距?
- RQ2可学习压缩函数中的区间数量如何影响低比特网络的性能?
- RQ3有限权重归一化(LWN)在量化网络中在多大程度上提升了训练稳定性和准确率?
- RQ4能否在降低查找表(LUT)外层位宽的同时,保持高模型准确率并减少推理时的内存开销?
- RQ5在多种架构与数据集上,LCQ与现有均匀及非均匀量化方法相比,在准确率与效率方面表现如何?
主要发现
- 在ImageNet上,2比特ResNet-50模型达到75.1%的top-1准确率,与全精度模型的准确率差距仅1.7%。
- LCQ在CIFAR-10/100、ImageNet和COCO数据集上的图像分类与目标检测任务中,均优于当前最先进的方法。
- 增加压缩函数中的区间数量可提升准确率,尤其在低比特位宽下效果更明显,表明灵活性与性能之间存在强关联。
- 有限权重归一化(LWN)在2比特量化中带来显著的准确率提升,在3至4比特水平也实现小幅增益,有效增强了训练稳定性。
- 将LUT的外层位宽从8位降低至4位,在CIFAR-10与ImageNet上均保持了小于0.2%的准确率下降,同时使LUT内存成本减半。
- LCQ在COCO目标检测任务中,达到与非均匀方法APoT相当或更优的平均精度(mAP),展现出在不同任务间的强大泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。