[论文解读] Gradient $\ell_1$ Regularization for Quantization Robustness
该论文提出使用梯度 ℓ₁ 正则化以提升神经网络在后训练量化中的鲁棒性,将量化建模为 ℓ∞-有界噪声,并利用梯度的 ℓ₁-范数来控制一阶损失扰动。该方法可在无需微调的情况下实现按需动态量化至多种位宽,相较于基线方法和量化感知训练,在低比特设置下表现更优,同时保持全精度精度。
We analyze the effect of quantizing weights and activations of neural networks on their loss and derive a simple regularization scheme that improves robustness against post-training quantization. By training quantization-ready networks, our approach enables storing a single set of weights that can be quantized on-demand to different bit-widths as energy and memory requirements of the application change. Unlike quantization-aware training using the straight-through estimator that only targets a specific bit-width and requires access to training data and pipeline, our regularization-based method paves the way for "on the fly'' post-training quantization to various bit-widths. We show that by modeling quantization as a $\ell_\infty$-bounded perturbation, the first-order term in the loss expansion can be regularized using the $\ell_1$-norm of gradients. We experimentally validate the effectiveness of our regularization scheme on different architectures on CIFAR-10 and ImageNet datasets.
研究动机与目标
- 为解决在移动设备和物联网系统等资源受限设备上部署神经网络的挑战。
- 提升微调后模型在无需微调或访问训练数据的情况下对多种位宽后训练量化的鲁棒性。
- 开发一种正则化方案,确保在多个位宽上同时对 ℓ∞-有界的量化噪声具有第一阶鲁棒性。
- 基于运行时资源约束(如电池电量或内存可用性)实现‘按需’量化。
提出的方法
- 将模型量化噪声建模为 ℓ∞-有界的扰动,其中每个权重和激活值在固定桶宽 δ 内被扰动。
- 在该扰动下推导损失函数的一阶泰勒展开,识别出梯度项为对量化最敏感的主要来源。
- 提出一种正则化项,通过惩罚网络参数的梯度 ℓ₁-范数,最小化量化对损失的最大影响。
- 在最终训练阶段或微调步骤中应用该正则化,无需修改训练流程,也无需使用直通估计器。
- 使用超参数 λ 平衡全精度精度与量化鲁棒性,通过网格搜索进行调优以保留 FP 性能。
- 证明该方法在架构(VGG、ResNet)和数据集(CIFAR-10、ImageNet)上均具泛化能力,实现跨位宽的一致性能表现。
实验结果
研究问题
- RQ1我们能否在不微调的情况下,对神经网络进行正则化,使其对多种位宽的后训练量化具有鲁棒性?
- RQ2将量化建模为 ℓ∞-有界噪声,如何为梯度敏感性提供一种原则性的正则化策略?
- RQ3在低比特设置下,梯度 ℓ₁ 正则化是否能优于现有方法(如量化感知训练或防御性量化)?
- RQ4所提方法是否能基于运行时资源约束实现按需动态量化至不同位宽?
- RQ5在应用梯度 ℓ₁ 正则化时,全精度精度与量化鲁棒性之间的权衡关系如何?
主要发现
- 在 CIFAR-10 上使用 VGG 类架构,所提 ℓ₁ 正则化在 8 位时达到 70.07% 的 top-1 准确率,在 4 位时达到 66.39%,优于基线和 L2 正则化。
- 在 ImageNet 上使用 ResNet-18,该方法在 8 位时达到 69.92%,在 4 位时达到 66.39%,在低比特下与或超过量化感知训练的性能。
- 当 λ=0.05 时,该方法在 CIFAR-10 上 4 位时达到 64.02% 的准确率,表明更强的正则化可在牺牲全精度精度的代价下恢复性能。
- 该方法优于防御性量化(Lin et al., 2019),后者因对奇异值的正则化过于严格而在 ResNet-18 上未能提升性能。
- 与 ℓ₂ 梯度正则化相比,ℓ₁ 正则化表现更优,证实了其在控制最坏情况梯度影响方面的理论优势。
- 该方法可在无需微调或访问数据的情况下,实现跨位宽的一致后训练量化,支持在不同资源约束下动态部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。