Skip to main content
QUICK REVIEW

[论文解读] Efficient Hardware Realization of Convolutional Neural Networks using Intra-Kernel Regular Pruning

Maurice Yang, Mahmoud Faraj|arXiv (Cornell University)|Mar 15, 2018
Advanced Neural Network Applications参考文献 21被引用 5
一句话总结

本文提出了一种细粒度剪枝方法——层内核正则剪枝(Intra-Kernel Regular, IKR),通过在卷积核内部移除冗余权重,同时保持核结构的规则性,以实现高效的硬件加速。该方法在仅造成小于1%准确率下降的情况下,实现了最高10倍的参数减少和7倍的计算量减少,使资源受限硬件上的紧凑、高效CNN推理成为可能。

ABSTRACT

The recent trend toward increasingly deep convolutional neural networks (CNNs) leads to a higher demand of computational power and memory storage. Consequently, the deployment of CNNs in hardware has become more challenging. In this paper, we propose an Intra-Kernel Regular (IKR) pruning scheme to reduce the size and computational complexity of the CNNs by removing redundant weights at a fine-grained level. Unlike other pruning methods such as Fine-Grained pruning, IKR pruning maintains regular kernel structures that are exploitable in a hardware accelerator. Experimental results demonstrate up to 10x parameter reduction and 7x computational reduction at a cost of less than 1% degradation in accuracy versus the un-pruned case.

研究动机与目标

  • 应对深度CNN在资源受限环境中日益增长的计算与内存需求。
  • 克服细粒度剪枝的局限性,即其产生的不规则稀疏性不利于高效硬件实现。
  • 开发一种结构化剪枝方法,保持规则的核模式,以实现高效硬件映射,同时实现高稀疏度。
  • 通过结合细粒度剪枝的优势与硬件友好的核结构,实现紧凑、低功耗的CNN推理。
  • 通过提出的稀疏处理引擎(Sparse Processing Engine, SPE)架构,证明其在硬件上的实际可行性。

提出的方法

  • 在每个卷积核内部以单个权重为单位应用层内核剪枝,以移除冗余参数。
  • 在核之间强制执行规则的剪枝模式,以保持结构规则性,从而实现高效的硬件映射。
  • 使用压缩稀疏模式(Compressed Sparse Pattern, CSP)格式,仅存储非零权重及其掩码索引,以最小化内存占用。
  • 采用模式生成与选择机制,识别在保持模型准确率前提下的最优剪枝模式。
  • 通过使用调度学习率的微调方法对剪枝后的网络进行再训练,以恢复剪枝后的准确率。
  • 设计一种专用于利用IKR剪枝核中规则稀疏性的稀疏处理引擎(SPE)硬件架构,以实现高效推理。

实验结果

研究问题

  • RQ1通过保持规则的核结构,能否使细粒度剪枝与高效硬件加速兼容?
  • RQ2在不造成显著准确率损失的前提下,使用层内核正则剪枝能否在CNN中实现参数和计算复杂度的大幅降低?
  • RQ3与现有的剪枝方法(如细粒度剪枝和核级剪枝)相比,IKR剪枝在稀疏度、准确率和硬件效率方面表现如何?
  • RQ4在结构化CNN剪枝中,稀疏度、准确率与硬件可实现性之间的最佳平衡点是什么?
  • RQ5专用硬件加速器(SPE)能否有效利用IKR剪枝生成的规则稀疏模式,实现高性能、低功耗的推理?

主要发现

  • 在LeNet-5上,IKR剪枝实现了网络参数最高10倍的减少和计算量7倍的减少,与未剪枝基线相比,错误率仅增加0.5%。
  • 在CIFAR-10数据集上使用$CNN_{small}$,IKR剪枝使模型大小减少4倍、计算量减少6倍,在相同1%准确率损失下,权重稀疏度略高于FMK剪枝。
  • 尽管进行了激进的压缩,IKR剪枝后的网络仍保持了高准确率(与未剪枝模型相差小于1%),证明了关键权重的有效保留。
  • 所提出的压缩稀疏模式(CSP)格式通过仅存储非零权重及其掩码索引,实现了IKR剪枝核的紧凑存储。
  • 稀疏处理引擎(SPE)架构被设计用于高效利用IKR剪枝核的规则稀疏性,实现了高吞吐量、低功耗的推理。
  • IKR剪枝在准确率上优于粗粒度剪枝方法,同时保持了硬件友好的结构,提供了稀疏度与效率之间的更优权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。