[论文解读] Efficient and Robust Quantization-aware Training via Adaptive Coreset Selection
本文提出自适应核心集选择(ACS),一种新颖的量化感知训练方法,通过使用误差向量得分(EVS)和分歧得分(DS)两种度量,动态选择有信息量的训练样本,以提升训练效率与准确率。通过在训练周期中自适应地平衡这两种度量,ACS仅使用ImageNet-1K数据集的10%即实现了最先进性能,在4-bit量化ResNet-18上达到68.39%的top-1准确率,相较于随机选择方法提升4.24%。
Quantization-aware training (QAT) is a representative model compression method to reduce redundancy in weights and activations. However, most existing QAT methods require end-to-end training on the entire dataset, which suffers from long training time and high energy costs. In addition, the potential label noise in the training data undermines the robustness of QAT. We propose two metrics based on analysis of loss and gradient of quantized weights: error vector score and disagreement score, to quantify the importance of each sample during training. Guided by these two metrics, we proposed a quantization-aware Adaptive Coreset Selection (ACS) method to select the data for the current training epoch. We evaluate our method on various networks (ResNet-18, MobileNetV2, RetinaNet), datasets(CIFAR-10, CIFAR-100, ImageNet-1K, COCO), and under different quantization settings. Specifically, our method can achieve an accuracy of 68.39\% of 4-bit quantized ResNet-18 on the ImageNet-1K dataset with only a 10\% subset, which has an absolute gain of 4.24\% compared to the baseline. Our method can also improve the robustness of QAT by removing noisy samples in the training set.
研究动机与目标
- 解决大规模数据集上量化感知训练(QAT)带来的高计算成本与长训练时间问题。
- 探究训练集中数据冗余是否可被利用以提升QAT效率,同时不牺牲准确率。
- 开发一种专为QAT设计的核心集选择策略,考虑量化模型训练的特殊动态特性。
- 设计能准确反映QAT过程中样本重要性的度量,兼顾损失梯度与知识蒸馏动态。
- 在多种网络与数据集上实现QAT中显著的数据效率提升,同时保持或提高模型准确率。
提出的方法
- 提出误差向量得分(EVS)作为基于QAT期间损失梯度分析的样本重要性理论近似。
- 引入分歧得分(DS)以衡量全精度模型与量化模型之间的预测差距,反映知识蒸馏动态。
- 设计一种自适应核心集选择(ACS)框架,通过可学习的退火策略结合EVS与DS,实现其在训练周期中的贡献平衡。
- 采用动态加权方案 $\beta(t)$,在训练早期侧重EVS,后期侧重DS,从而提升数据多样性与收敛性。
- 采用两阶段选择流程:先计算所有样本的EVS与DS,再基于加权组合每轮选择前-k名样本。
- 使用余弦退火策略处理 $\beta(t)$,实现从早期到后期训练优先级的平滑过渡,优于固定或线性调度策略。
实验结果
研究问题
- RQ1在量化感知训练过程中,样本重要性如何变化?是否可使用基于梯度的度量有效量化?
- RQ2结合误差向量得分(EVS)与分歧得分(DS)是否能提升QAT中的核心集选择效果,优于单独使用任一指标?
- RQ3如何在训练周期中调整EVS与DS的相对权重,以最大化QAT的效率与准确率?
- RQ4核心集选择在多大程度上可减少QAT中的数据使用量,同时在ImageNet-1K与CIFAR-100上保持或提升模型性能?
- RQ5在QAT的核心集选择中,平衡EVS与DS的最佳退火策略是什么?
主要发现
- ACS在仅使用10% ImageNet-1K训练数据的条件下,实现了4-bit量化ResNet-18的68.39% top-1准确率,相较于随机选择方法绝对提升4.24%。
- 在CIFAR-100上进行仅2-bit权重量化时,ACS仅使用50%的训练数据即达到67.19%的平均准确率,优于基线核心集方法。
- 余弦退火策略在 $\beta(t)$ 上表现最佳,优于固定、线性、平方根与二次调度策略。
- 分歧得分(DS)的分布随时间趋于零,证实其在追踪模型收敛与知识蒸馏进展中的作用。
- 可视化结果表明,与随机选择或基线核心集选择相比,采用ACS的QAT产生更平滑且更集中的损失景观。
- 消融实验确认EVS与DS具有互补性:EVS在小数据比例下表现更优,而DS在数据量较大时进一步提升性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。