[论文解读] Benchmarking the Reliability of Post-training Quantization: a Particular Focus on Worst-case Performance
本文提出了一套系统性框架,用于基准测试后训练量化(PTQ)方法在分布偏移下的可靠性。研究发现,尽管平均准确率保持稳定,但在低比特量化或存在噪声的校准数据下,个别类别仍出现显著的准确率下降,暴露出当前SOTA PTQ方法在最坏情况下的关键可靠性缺陷,尽管其平均性能表现强劲。
Post-training quantization (PTQ) is a popular method for compressing deep neural networks (DNNs) without modifying their original architecture or training procedures. Despite its effectiveness and convenience, the reliability of PTQ methods in the presence of some extrem cases such as distribution shift and data noise remains largely unexplored. This paper first investigates this problem on various commonly-used PTQ methods. We aim to answer several research questions related to the influence of calibration set distribution variations, calibration paradigm selection, and data augmentation or sampling strategies on PTQ reliability. A systematic evaluation process is conducted across a wide range of tasks and commonly-used PTQ paradigms. The results show that most existing PTQ methods are not reliable enough in term of the worst-case group performance, highlighting the need for more robust methods. Our findings provide insights for developing PTQ methods that can effectively handle distribution shift scenarios and enable the deployment of quantized DNNs in real-world applications.
研究动机与目标
- 研究PTQ方法在极端测试条件(如分布偏移和数据噪声)下的可靠性。
- 识别影响最坏情况性能的因素——包括校准集分布、量化设置和优化算法。
- 开发一种标准化框架,用于评估PTQ可靠性,超越平均准确率,重点关注子组和类别级别的性能。
- 揭示当前PTQ方法在最坏情况鲁棒性至关重要的风险敏感型应用中的局限性。
提出的方法
- 提出一种系统性评估框架,评估PTQ在平均指标和最坏情况子组(如稀有或分布外类别)中的表现。
- 采用多样化数据集(CIFAR-10、ImageNet)和网络架构(ResNet20、MobileNetV2),在不同条件下评估可靠性。
- 测试多种校准集构成,包括分布偏移和注入噪声,以分析其对量化模型性能的影响。
- 评估四种优化算法:网格搜索、Adaround、BRECQ和QDrop,比较其平均准确率与各类别准确率的稳定性。
- 通过50次随机种子的统计分析,测量各类别准确率的标准差,量化可靠性方差。
- 引入一个基准测试流程,实现模型、任务和数据集之间PTQ可靠性的可复现、标准化评估。
实验结果
研究问题
- RQ1校准集分布的变化在多大程度上影响量化模型的最坏情况性能?
- RQ2不同量化设置(如比特宽度)如何影响特定类别上的性能退化?
- RQ3尽管平均准确率相似,不同PTQ优化算法在各类别可靠性方面有何差异?
- RQ4校准过程中数据增强或采样策略在多大程度上影响最坏情况下的鲁棒性?
- RQ5即使在实现高平均准确率的情况下,基于梯度的PTQ方法是否能在分布偏移下保持可靠性?
主要发现
- 量化后,某些类别出现显著的准确率下降,部分类别下降超过10个百分点,表明最坏情况下的可靠性较差。
- 尽管在校准集分布偏移或噪声下平均准确率保持稳定,各类别准确率仍表现出高度敏感性,尤其在低比特设置下。
- 将比特宽度从6位降低到4位,导致特定类别性能显著下降,例如在CIFAR-10的第4类中,W4A4量化下准确率下降15.5%。
- 基于梯度的方法(如QDrop)虽实现高平均准确率(ImageNet W6A6下为72.1%),但各类别准确率标准差较高(最高达±2.77),表明可靠性较低。
- 在ImageNet上,QDrop在第1类中实现68.8%的准确率,而网格搜索为70.6%,表明优越的平均性能并不保证鲁棒性。
- 在50次运行中,各类别准确率的标准差最高的是QDrop(最高达±2.95),证实尽管平均结果强劲,基于梯度的方法在最坏情况场景下仍可靠性较低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。