Skip to main content
QUICK REVIEW

[论文解读] Structural Pruning in Deep Neural Networks: A Small-World Approach

Gokul Krishnan, Xiaocong Du|arXiv (Cornell University)|Nov 11, 2019
Advanced Neural Network Applications参考文献 23被引用 5
一句话总结

本文提出一种结构化剪枝方法,在训练前将深度神经网络转换为小世界拓扑结构,利用高聚类性和低特征路径长度,实现全局稀疏、局部密集的网络架构。通过在初始化阶段强制实施小世界特性,该方法将LeNet-5(MNIST)的参数量减少至2.3%,VGG-16(CIFAR-10)减少至9.02%,同时保持高准确率,显著降低硬件部署的内存和互连开销。

ABSTRACT

Deep Neural Networks (DNNs) are usually over-parameterized, causing excessive memory and interconnection cost on the hardware platform. Existing pruning approaches remove secondary parameters at the end of training to reduce the model size; but without exploiting the intrinsic network property, they still require the full interconnection to prepare the network. Inspired by the observation that brain networks follow the Small-World model, we propose a novel structural pruning scheme, which includes (1) hierarchically trimming the network into a Small-World model before training, (2) training the network for a given dataset, and (3) optimizing the network for accuracy. The new scheme effectively reduces both the model size and the interconnection needed before training, achieving a locally clustered and globally sparse model. We demonstrate our approach on LeNet-5 for MNIST and VGG-16 for CIFAR-10, decreasing the number of parameters to 2.3% and 9.02% of the baseline model, respectively.

研究动机与目标

  • 为解决DNN中过度参数化和结构冗余问题,这些问题会增加硬件平台上的内存和互连开销。
  • 通过利用小世界网络特性——高聚类性和低路径长度——在训练前减少模型大小和互连成本。
  • 构建一种结构化稀疏DNN架构,通过局部密集、全局稀疏的连接方式,实现高效的硬件实现。
  • 在保持或匹配基线准确率的前提下,实现比现有剪枝方法更高的模型压缩率。

提出的方法

  • 该方法首先通过基于网络结构特性的随机重连(概率为$ p $)将预训练的DNN转换为小世界网络。
  • 在训练前强制实现小世界结构,确保高聚类系数(C)和低特征路径长度(L),模拟大脑网络的高效性。
  • 从这种稀疏且聚类的初始化状态开始训练网络,剪枝过程同时受结构约束和参数重要性指导。
  • 最终模型经过优化以保持高准确率,即使在参数量大幅减少的情况下也表现优异。
  • 对各层互连密度进行分析,结果显示高层的互连密度为基线的20%或以下,而低层为40–60%,这是由于特征相关性和聚类所致。
  • 通过准确率评估对随机性参数$ p $进行调优,以找到稀疏性与性能之间的最佳平衡。

实验结果

研究问题

  • RQ1小世界网络结构能否在训练前有效应用于DNN,以减少模型大小和互连成本?
  • RQ2在初始化阶段强制实施小世界特性(高C,低L)如何影响模型准确率和参数效率?
  • RQ3基于小世界拓扑的预训练结构化剪枝是否能在参数压缩率和硬件效率方面优于标准的训练后剪枝?
  • RQ4在DNN中,维持高准确率的同时最大化稀疏性的最优随机性水平($ p $)是多少?
  • RQ5在小世界结构DNN中,各层的互连密度如何变化?这对硬件设计有何启示?

主要发现

  • 在MNIST上的LeNet-5中,小世界模型将参数量减少至基线的2.3%,实现97.7%的压缩率,优于[4]等先前方法的参数效率。
  • 在CIFAR-10上的VGG-16中,该方法将参数量减少90.8%(从41.5M降至3.74M),同时保持93.24%的准确率,压缩效率超过[5]。
  • 最优随机性参数$ p $被确定为LeNet-5的0.001和VGG-16的0.0001,实现了稀疏性与准确率的最佳平衡。
  • 分层分析显示,低层因特征相关性更强而保持较高的互连密度(40–60%),而高层更稀疏(≤20%)。
  • 小世界方法生成了局部密集、全局稀疏的架构,支持高效硬件映射,显著降低内存和互连开销。
  • 该方法在大幅减少模型大小的同时,实现了与基线模型相当或更优的准确率,证明了基于网络拓扑的结构化剪枝的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。