[论文解读] Adaptive Sharpness-Aware Pruning for Robust Sparse Networks
AdaSAP 提出了一种三阶段剪枝框架,通过在损失曲面中优化平坦最小值,结合自适应权重扰动与平滑度正则化,显著提升了模型的鲁棒性与稀疏性。该方法在多种架构与稀疏度水平下均达到当前最优性能,在 ImageNet-C 上将鲁棒准确率提升最高达 +6%,在损坏的 VOC 数据集上提升最高达 +4%。
Robustness and compactness are two essential attributes of deep learning models that are deployed in the real world. The goals of robustness and compactness may seem to be at odds, since robustness requires generalization across domains, while the process of compression exploits specificity in one domain. We introduce Adaptive Sharpness-Aware Pruning (AdaSAP), which unifies these goals through the lens of network sharpness. The AdaSAP method produces sparse networks that are robust to input variations which are unseen at training time. We achieve this by strategically incorporating weight perturbations in order to optimize the loss landscape. This allows the model to be both primed for pruning and regularized for improved robustness. AdaSAP improves the robust accuracy of pruned models on image classification by up to +6% on ImageNet C and +4% on ImageNet V2, and on object detection by +4% on a corrupted Pascal VOC dataset, over a wide range of compression ratios, pruning criteria, and network architectures, outperforming recent pruning art by large margins.
研究动机与目标
- 为解决深度神经网络在模型紧凑性与对分布偏移及数据损坏鲁棒性之间联合优化的开放挑战。
- 通过损失曲面平坦度的视角统一稀疏性与鲁棒性,避免压缩与泛化能力之间的权衡。
- 开发一种剪枝方法,使模型在分布偏移与图像损坏下仍保持高性能,尤其在高稀疏度比下表现优异。
- 证明基于平坦度的优化可同时为剪枝与提升分布外输入的鲁棒性做好准备。
提出的方法
- 在微调过程中应用自适应权重扰动,以促使可能被剪枝区域的损失曲面趋向更平坦的最小值,从而最小化低重要性神经元移除后的性能下降。
- 在自适应扰动后应用结构化剪枝步骤,利用显著性标准(如权重大小或泰勒近似)识别并移除冗余通道。
- 剪枝后,通过在所有层上施加统一的平滑度惩罚进行微调,以促进更平坦的损失曲面,提升鲁棒泛化能力。
- 该方法采用改进的损失函数,其中包含基于有界权重扰动下最大损失增加的平滑度正则化项,定义为 $\max_{\|\epsilon\|_{2}\leq\rho}L_{S}(w+\epsilon)-L_{S}(w)$。
- 该方法兼容多种剪枝标准与网络架构,包括 ResNet50、MobileNet V1/V2 和 SSD512,适用于分类与检测任务。
- 该方法对具体剪枝标准保持无感知,可无缝集成大小、泰勒或其他重要性度量方法。
实验结果
研究问题
- RQ1统一的优化策略是否能同时提升模型稀疏性与对分布偏移及图像损坏的鲁棒性?
- RQ2训练过程中自适应权重扰动是否能引导模型收敛至更平坦的最小值,从而增强对剪枝与分布外输入的鲁棒性?
- RQ3剪枝后通过平滑度正则化在多大程度上能提升鲁棒泛化能力而不损失准确率?
- RQ4在高稀疏度比与多样化数据损坏条件下,AdaSAP 与 SOTA 剪枝方法相比表现如何?
主要发现
- 在高稀疏度水平下,与 SOTA 剪枝方法相比,AdaSAP 在 ImageNet-C 上将鲁棒准确率提升 +6%,在 ImageNet-V2 与损坏的 VOC 数据集上提升 +4%。
- 在 80% 剪枝率下,AdaSAP 搭配大小剪枝方法在 ImageNet-C 上达到 37.30% 的鲁棒准确率,优于次优方法 3.33 个百分点。
- 通过平滑度度量,模型在剪枝前后的损失曲面均保持更平坦,平滑度值分别为 0.037(剪枝前)与 0.039(剪枝后),始终低于基线方法。
- 置信区间显示在三个随机种子下性能稳定,AdaSAP 在 23% 剪枝率下达到 78.23±0.06% 的干净验证准确率,显著优于基线方法。
- AdaSAP 在多种剪枝标准下均表现出灵活性与高效性:其性能优于 SGD 搭配泰勒剪枝,且在大小剪枝下匹配或超越其他方法。
- 该方法在多种设置下均达到 SOTA 水平,涵盖两类任务(分类与检测)、四种网络、两种剪枝范式(参数与延迟导向),以及 25% 至 80% 的稀疏度比。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。