Skip to main content
QUICK REVIEW

[论文解读] Lossless CNN Channel Pruning via Gradient Resetting and Convolutional Re-parameterization

Xiaohan Ding, Tianxiang Hao|arXiv (Cornell University)|Jul 7, 2020
Advanced Neural Network Applications参考文献 4被引用 5
一句话总结

该论文提出了一种新颖的通道剪枝方法,将卷积神经网络(CNN)重参数化为‘记忆’和‘遗忘’两个组件,前者使用标准随机梯度下降(SGD)进行训练,后者采用惩罚梯度更新以诱导结构化稀疏性。该方法实现了在不损失精度的前提下对ResNet-50进行无损剪枝,FLOPs降低至43.9%,在ImageNet上达到76.15%的top-1准确率。

ABSTRACT

Channel pruning (a.k.a. filter pruning) aims to slim down a convolutional neural network (CNN) by reducing the width (i.e., numbers of output channels) of convolutional layers. However, as CNN's representational capacity depends on the width, doing so tends to degrade the performance. A traditional learning-based channel pruning paradigm applies a penalty on parameters to improve the robustness to pruning, but such a penalty may degrade the performance even before pruning. Inspired by the neurobiology research about the independence of remembering and forgetting, we propose to re-parameterize a CNN into the remembering parts and forgetting parts, where the former learn to maintain the performance and the latter learn for efficiency. By training the re-parameterized model using regular SGD on the former but a novel update rule with penalty gradients on the latter, we achieve structured sparsity, enabling us to equivalently convert the re-parameterized model into the original architecture with narrower layers. With our method, we can slim down a standard ResNet-50 with 76.15\% top-1 accuracy on ImageNet to a narrower one with only 43.9\% FLOPs and no accuracy drop. Code and models are released at this https URL.

研究动机与目标

  • 为解决通道剪枝导致深层CNN因表征能力下降而引起的性能下降问题。
  • 克服传统基于正则化的剪枝方法在剪枝前即导致性能下降的局限性。
  • 通过受神经生物学启发的性能保持与效率提升学习过程分离,实现在CNN中的结构化稀疏性。
  • 开发一种重参数化策略,使主网络可使用标准SGD进行训练,同时通过新型更新规则对通道进行剪枝而不造成性能损失。
  • 在保持原始精度的前提下,显著降低标准ImageNet基准测试中的FLOPs。

提出的方法

  • 将CNN重参数化为两个独立组件:‘记忆’部分和‘遗忘’部分,前者保持性能,后者实现效率提升。
  • 使用标准随机梯度下降(SGD)训练记忆组件,以维持表征能力。
  • 对遗忘组件应用一种新颖的更新规则,结合惩罚梯度,以促进通道权重的结构化稀疏性。
  • 通过梯度重置将遗忘过程与主网络的学习动态解耦,模拟生物记忆机制。
  • 训练完成后,通过移除已剪枝通道,将模型重参数化为紧凑的窄层结构,从而将重参数化后的模型转化为精简的CNN。
  • 利用卷积重参数化技术,在剪枝后保持推理效率与模型精度。

实验结果

研究问题

  • RQ1是否可以在不造成性能下降的前提下,将CNN重参数化为用于性能保持与通道剪枝的独立组件?
  • RQ2在专用的‘遗忘’组件上应用惩罚梯度更新规则,是否能比传统正则化方法更有效地实现结构化稀疏性?
  • RQ3所提出的方法是否能在ResNet-50等标准CNN中实现显著的FLOPs降低,同时保持原始精度?
  • RQ4与端到端微调相比,将独立记忆与遗忘过程类比为神经生物学机制,是否能更有效地提升剪枝性能?
  • RQ5该方法在不重新训练的情况下,能否推广至其他架构与数据集?

主要发现

  • 所提方法在ResNet-50上实现了43.9%的FLOPs降低,且在ImageNet上的top-1准确率无下降,保持在76.15%。
  • 通过一种新颖的梯度重置机制实现结构化稀疏性,实现了有效通道剪枝且无性能下降。
  • 将学习过程分离为记忆与遗忘组件,使网络在保持表征能力的同时实现高效剪枝。
  • 与传统基于正则化的剪枝方法相比,该方法避免了剪枝过程中的性能下降,表现更优。
  • 重参数化后的模型可转化为等效性能的标准窄层CNN架构,适用于资源受限环境的部署。
  • 该方法在标准基准测试中表现有效,证明通过架构重参数化与定向梯度更新可实现无损剪枝。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。