[论文解读] Trainability Preserving Neural Pruning
本文提出训练可微性保持剪枝(TPP),一种结构化剪枝方法,通过正则化剪除滤波器与保留滤波器之间的格拉姆矩阵,以解耦它们之间的相关性,同时对批量归一化参数进行正则化,从而保持神经网络的可训练性。TPP在CIFAR-10/100和ImageNet-1K上达到最先进性能,尤其在高稀疏度下表现更优,且在线性网络中与最优可训练性恢复方案相当。
Many recent works have shown trainability plays a central role in neural network pruning -- unattended broken trainability can lead to severe under-performance and unintentionally amplify the effect of retraining learning rate, resulting in biased (or even misinterpreted) benchmark results. This paper introduces trainability preserving pruning (TPP), a scalable method to preserve network trainability against pruning, aiming for improved pruning performance and being more robust to retraining hyper-parameters (e.g., learning rate). Specifically, we propose to penalize the gram matrix of convolutional filters to decorrelate the pruned filters from the retained filters. In addition to the convolutional layers, per the spirit of preserving the trainability of the whole network, we also propose to regularize the batch normalization parameters (scale and bias). Empirical studies on linear MLP networks show that TPP can perform on par with the oracle trainability recovery scheme. On nonlinear ConvNets (ResNet56/VGG19) on CIFAR10/100, TPP outperforms the other counterpart approaches by an obvious margin. Moreover, results on ImageNet-1K with ResNets suggest that TPP consistently performs more favorably against other top-performing structured pruning approaches. Code: https://github.com/MingSun-Tse/TPP.
研究动机与目标
- 解决结构化神经网络剪枝中的可训练性退化这一关键问题,该问题会损害性能和超参数鲁棒性。
- 克服现有剪枝方法在ResNet和VGG等深度卷积网络中无法保持可训练性的局限。
- 开发一种可扩展的基于正则化的方案,在不依赖剪枝后微调启发式策略的前提下,保持剪枝过程中的可训练性。
- 显式考虑批量归一化参数在剪枝中的作用,因为其未加注意的移除会严重损害可训练性。
- 在线性网络中实现与最优可训练性恢复相当的性能,并在非线性卷积网络中超越最先进方法。
提出的方法
- 提出对卷积滤波器格拉姆矩阵的新型正则化,特别针对剪除滤波器与保留滤波器之间的互相关性,以减少依赖性并保持可训练性。
- 避免对保留(重要)滤波器的自相关性施加过度惩罚,与传统正交性约束不同,从而防止优化退化并避免陷入次优局部极小值。
- 引入对批量归一化(BN)缩放和偏移参数的正则化项,以缓解剪枝过程中移除BN层导致的性能下降。
- 在预剪枝阶段应用正则化,确保剪枝后的模型从一开始就保持可训练性,即使在微调之前也是如此。
- 采用两阶段训练流程:首先对剪枝模型应用TPP正则化,然后通过标准微调进行优化。
- 将格拉姆矩阵正则化表述为可微损失项,以鼓励剪除滤波器与保留滤波器之间的零互相关性。
实验结果
研究问题
- RQ1基于正则化的剪枝方法是否能在ResNet和VGG等深度卷积网络中保持网络可训练性,而这些网络中先前的方法已失效?
- RQ2将剪除滤波器与保留滤波器解耦对最终准确率以及对学习率等微调超参数的鲁棒性有何影响?
- RQ3在结构化剪枝过程中,批量归一化参数在可训练性损失中的贡献程度如何?能否通过显式正则化来提升性能?
- RQ4所提方法是否在ImageNet-1K等大规模基准上超越现有最先进结构化剪枝方法?
- RQ5在高稀疏度下(此时可训练性退化最为严重),该方法表现如何?
主要发现
- 在CIFAR-10/100的ResNet56和VGG19上,TPP优于所有对比基线方法,包括幅度剪枝和其他基于正交性的方法,尤其在高稀疏度下表现更优。
- 在ImageNet-1K上,ResNet50在2.31×加速下,TPP相比次优方法提升1.15%的top-1准确率;在3.06×加速下,提升达2.87%。
- 在线性MLP中,TPP实现与最优可训练性恢复方案相当的性能,证明其在保持内在可训练性方面的有效性。
- 消融研究证实,格拉姆矩阵正则化与BN参数正则化均不可或缺:任一缺失都会导致性能下降,尤其在高稀疏度下。
- 与仅正则化对角项相比,基于解耦的正则化方法表现更优,尤其在稀疏度比为0.7及以上时,VGG19在0.7剪枝率下准确率提升最高达3.5%。
- 在ImageNet-1K上,TPP在多个FLOP水平下均超越最先进方法CHEX,证明其可扩展性与对激进剪枝的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。