Skip to main content
QUICK REVIEW

[论文解读] PCNN: Pattern-based Fine-Grained Regular Pruning towards Optimizing CNN Accelerators

Zhanhong Tan, Jiebo Song|arXiv (Cornell University)|Feb 11, 2020
Advanced Neural Network Applications参考文献 17被引用 7
一句话总结

PCNN 提出了一种基于新型稀疏模式掩码(SPM)索引格式的细粒度、规则化一维权重重剪枝方法,用于编码核级稀疏性,从而实现高效的硬件部署。在 55nm 工艺下,该方法实现了最高 9.0× 的加速比和 28.39 TOPS/W 的能效,仅带来 3.1% 的片上内存开销,且在 VGG-16 和 ResNet-18 上的精度损失低于 0.2%。

ABSTRACT

Weight pruning is a powerful technique to realize model compression. We propose PCNN, a fine-grained regular 1D pruning method. A novel index format called Sparsity Pattern Mask (SPM) is presented to encode the sparsity in PCNN. Leveraging SPM with limited pruning patterns and non-zero sequences with equal length, PCNN can be efficiently employed in hardware. Evaluated on VGG-16 and ResNet-18, our PCNN achieves the compression rate up to 8.4X with only 0.2% accuracy loss. We also implement a pattern-aware architecture in 55nm process, achieving up to 9.0X speedup and 28.39 TOPS/W efficiency with only 3.1% on-chip memory overhead of indices.

研究动机与目标

  • 解决因高索引开销和工作负载不平衡导致的不规则权重重剪枝在硬件上的低效问题。
  • 在保持高模型精度的同时,降低卷积神经网络加速器中的内存和计算开销。
  • 开发一种规则化、细粒度的剪枝方法,以实现在并行处理单元之间的工作负载均衡。
  • 通过紧凑的索引格式(SPM)实现硬件友好的稀疏性编码,以减少位宽和存储需求。
  • 展示与其它压缩技术(如通道剪枝和核剪枝)的正交性与兼容性,以实现更高的整体压缩率。

提出的方法

  • 提出稀疏模式掩码(SPM),一种基于核的索引格式,使用每个核的单一索引编码其非零权重的模式。
  • 在给定层的所有核中强制实现相同的稀疏性(即非零权重数量相同),以确保规则性与工作负载均衡。
  • 应用多重背包框架以提炼并减少唯一稀疏模式的数量,从而最小化 SPM 的位宽和索引存储成本。
  • 在 55nm 工艺下设计一种模式感知的加速器架构,并通过专用内存优化技术,映射 SPM 编码的权值和激活值。
  • 实现一种稀疏性感知的处理元素(PE)阵列,利用基于 SPM 的索引格式,同时处理稀疏权值和激活值。
  • 将 PCNN 与现有剪枝方法(如通道剪枝和核剪枝)集成,以实现正交、累积的压缩增益。

实验结果

研究问题

  • RQ1一种细粒度、规则化的剪枝方法是否能在保持高模型精度的同时,降低硬件索引开销?
  • RQ2如何紧凑地编码核级稀疏模式,以最小化卷积神经网络加速器中的内存和面积开销?
  • RQ3通过采用统一核稀疏性的规则化剪枝,对并行处理单元之间的负载均衡改善程度如何?
  • RQ4所提出的基于 SPM 的剪枝方法是否能以极低的性能和能效成本高效映射到硬件?
  • RQ5当 PCNN 方法与其他压缩技术(如通道剪枝)结合时,在压缩率和精度方面表现如何?

主要发现

  • PCNN 在 VGG-16 和 ResNet-18 上实现了最高 8.4× 的模型压缩率,精度损失仅为 0.2%。
  • 所提出的 55nm 模式感知加速器实现了最高 9.0× 的加速比和 28.39 TOPS/W 的能效,且索引的片上内存开销仅为 3.1%。
  • 与不规则剪枝相比,SPM 索引格式显著降低了索引存储开销,每层 16 种模式下仅需 3.1% 的内存开销。
  • PCNN 与通道剪枝和核级剪枝正交,可在 VGG-16 上实现高达 34.4× 的综合压缩率,且精度损失可忽略不计。
  • 该架构保持了高并行性和效率,在 88.9% 的稀疏度下实现了 28.39 TOPS/W 的能效,展现出强大的硬件效率。
  • 模式 SRAM 仅占用芯片面积的 2.4% 和功耗的 1.9%,证实了索引存储的硬件开销极低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。