Skip to main content
QUICK REVIEW

[论文解读] Generative Low-bitwidth Data Free Quantization

Shoukai Xu, Haokun Li|arXiv (Cornell University)|Mar 7, 2020
Advanced Neural Network Applications参考文献 54被引用 14
一句话总结

该论文提出了一种新型的无真实训练数据4比特神经网络量化方法——生成式低比特量化(GDFQ)。该方法通过利用预训练模型中批量归一化统计信息提取的分类边界和激活分布知识,训练一个知识匹配生成器以合成高质量的虚假数据,从而实现有效的量化与微调。该方法在4比特量化任务上实现了当前最优的准确率,显著优于现有的无数据方法(如ZeroQ和DFQ)。

ABSTRACT

Neural network quantization is an effective way to compress deep models and improve their execution latency and energy efficiency, so that they can be deployed on mobile or embedded devices. Existing quantization methods require original data for calibration or fine-tuning to get better performance. However, in many real-world scenarios, the data may not be available due to confidential or private issues, thereby making existing quantization methods not applicable. Moreover, due to the absence of original data, the recently developed generative adversarial networks (GANs) cannot be applied to generate data. Although the full-precision model may contain rich data information, such information alone is hard to exploit for recovering the original data or generating new meaningful data. In this paper, we investigate a simple-yet-effective method called Generative Low-bitwidth Data Free Quantization (GDFQ) to remove the data dependence burden. Specifically, we propose a knowledge matching generator to produce meaningful fake data by exploiting classification boundary knowledge and distribution information in the pre-trained model. With the help of generated data, we can quantize a model by learning knowledge from the pre-trained model. Extensive experiments on three data sets demonstrate the effectiveness of our method. More critically, our method achieves much higher accuracy on 4-bit quantization than the existing data free quantization method. Code is available at https://github.com/xushoukai/GDFQ.

研究动机与目标

  • 解决在缺乏真实训练数据或受隐私限制的环境中低比特量化带来的挑战。
  • 开发一种无需依赖真实数据进行后训练量化中校准或微调的方法。
  • 利用预训练模型中的隐含知识(特别是分类边界和激活分布)生成有意义的合成数据。
  • 在4比特精度下,相比现有无数据量化方法,实现更优的量化准确率。

提出的方法

  • 训练一个知识匹配生成器,通过与全精度模型批量归一化统计(BNS)中提取的分类边界和激活分布信息对齐,生成虚假数据。
  • 通过最大化全精度模型在生成样本上的分类准确率来优化生成器,确保生成数据在语义上相关且分布上一致。
  • 使用生成的虚假数据对量化模型进行微调,通过交替训练生成器与量化模型,提升数据多样性与模型性能。
  • 基于分类准确率阈值设置停止条件,以控制生成器训练时长,消融实验表明更长的训练可获得更优结果。
  • 采用两阶段损失函数:第一阶段用于知识匹配(使虚假数据与BNS对齐),第二阶段通过生成数据上的交叉熵损失实现模型微调。
  • 端到端应用该方法:生成虚假数据 → 量化模型 → 使用虚假数据进行微调,全程无需访问真实数据。

实验结果

研究问题

  • RQ1能否在无真实训练数据访问的情况下,训练生成器以生成高质量、语义有意义的数据用于模型量化?
  • RQ2能否有效利用批量归一化统计信息中的分类边界与激活分布知识,指导无数据量化中的数据生成?
  • RQ3与独立训练相比,交替训练生成器与量化模型是否能提升量化准确率?
  • RQ4在低比特宽度下,无数据量化性能如何随比特宽度降低而变化,特别是在4比特时表现如何?
  • RQ5所提方法能否在低比特设置下超越现有无数据量化基线(如ZeroQ和DFQ)?

主要发现

  • 在ImageNet上,GDFQ在ResNet-50的W4A4量化中达到55.65%的top-1准确率,显著优于ZeroQ的0.12%和DFQ的0.11%。
  • 对于MobileNetV2,GDFQ在4比特下达到51.30%的top-1准确率,而ZeroQ为3.31%,DFQ为0.11%,展现出显著的性能提升。
  • 交替训练生成器与量化模型可达到63.91%的准确率,优于独立训练的61.81%,表明联合优化具有优势。
  • 过早停止生成器训练(如在99%阈值处)会导致次优结果;最佳性能需在训练收敛后获得。
  • 该方法在4比特量化中实现了SOTA性能,确立了无数据低比特量化的新SOTA。
  • 性能提升在低比特宽度下最为显著,GDFQ在4比特时相对于基线的增益远大于6比特或8比特时。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。