Skip to main content
QUICK REVIEW

[论文解读] Hierarchical Block Sparse Neural Networks

Dharma Teja Vooturi, Dheevatsa Mudigere|arXiv (Cornell University)|Aug 10, 2018
Advanced Neural Network Applications参考文献 9被引用 14
一句话总结

本文提出分层块稀疏神经网络(HBsNN),一种结构化稀疏方法,通过结合多级块稀疏性,在模型准确率与计算性能之间实现平衡。通过实现灵活的多级结构化剪枝——其中更细粒度的块保留高权重值,而更粗粒度的块提升硬件效率——HBsNN 在准确率上优于高度结构化稀疏性,在性能上优于非结构化稀疏性,在 50% 稀疏度下达到 75.63% 的 top-1 准确率,累计稀疏度达 87.5%。

ABSTRACT

Sparse deep neural networks(DNNs) are efficient in both memory and compute when compared to dense DNNs. But due to irregularity in computation of sparse DNNs, their efficiencies are much lower than that of dense DNNs on regular parallel hardware such as TPU. This inefficiency leads to poor/no performance benefits for sparse DNNs. Performance issue for sparse DNNs can be alleviated by bringing structure to the sparsity and leveraging it for improving runtime efficiency. But such structural constraints often lead to suboptimal accuracies. In this work, we jointly address both accuracy and performance of sparse DNNs using our proposed class of sparse neural networks called HBsNN (Hierarchical Block sparse Neural Networks). For a given sparsity, HBsNN models achieve better runtime performance than unstructured sparse models and better accuracy than highly structured sparse models.

研究动机与目标

  • 解决稀疏深度神经网络(DNNs)中模型准确率与运行时性能之间的权衡问题。
  • 克服非结构化稀疏性(硬件性能差)和高度结构化稀疏性(准确率较低)的局限性。
  • 设计一种稀疏性框架,在保留高权重参数的同时,实现在通用硬件上的高效计算。
  • 实现可在多个分层级别灵活流动的结构化稀疏性,以同时提升准确率与效率。

提出的方法

  • 提出 HBsNN,一种分层稀疏性框架,其中在各层上应用多级块稀疏性,块大小可变(例如 32x1、16x1、8x1、4x1、1x1)。
  • 采用多级剪枝策略:更粗粒度的块(如 32x1)提升计算效率,更细粒度的块(如 1x1)保留高权重值以保障准确率。
  • 实施分层稀疏性分布:累计稀疏度设为 50%,稀疏度按层级分配(如 L1 为 75%,L2 为 93.75% 等),以维持稀疏性的流畅性。
  • 实现准块稀疏配置,即一级块稀疏性与一级非结构化稀疏性(1x1)结合,以平衡性能与准确率。
  • 采用标准的剪枝-微调流程:使用基于权重大小的剪枝方法剪除 50% 的参数,随后以学习率衰减策略进行 18 个周期的微调。
  • 设计性能模型以估算加速比:$ \text{SpeedUp} = \frac{C_{\text{dense}}}{C_{\text{sparse}}} $,其中 $ C $ 表示计算成本。

实验结果

研究问题

  • RQ1与高度结构化稀疏性相比,分层块稀疏性是否能在保持性能优势的同时提升模型准确率?
  • RQ2在多个分层块大小上分配稀疏性,如何影响模型准确率与计算效率?
  • RQ3与固定块稀疏性相比,灵活的多级稀疏性在多大程度上能保留高权重值?
  • RQ4在准块配置中结合块稀疏性(用于性能)与非结构化稀疏性(用于准确率),是否能优于单独使用任一方法?
  • RQ5块大小与稀疏度分配的选择,如何影响准确率与计算效率之间的权衡?

主要发现

  • HBsNN 在 50% 稀疏度下实现 75.63% 的 top-1 准确率,累计稀疏度达 87.5%,在相似条件下优于标准 32x1 块稀疏性(74.52%)与非结构化稀疏性(76.42%)的准确率。
  • 采用分层稀疏度分布(如 L1 为 75%,L2 为 93.75%,L3 为 96.875%)时,top-1 准确率在 50% 累计稀疏度下提升至 75.63%,证明了结构流畅性的优势。
  • 准块稀疏配置(如 32x1 块 + 1x1 非结构化)在 50% 稀疏度下实现 75.92% 的 top-1 准确率,表明结合性能与准确率组件可提升整体效果。
  • 当块大小从 4x1 增加到 32x1 时,50% 稀疏度下的 top-1 准确率从 75.73% 下降至 74.52%,证实更大的块会剪除更多高权重值。
  • 在更多分层级别上分配稀疏度(如 5 个层级)相比单级块稀疏性可提升准确率,相同累计稀疏度下 top-1 准确率从 74.52% 提升至 75.63%。
  • 性能模型证实,计算成本的降低与稀疏度成比例,且 HBsNN 的结构化设计可在不损失准确率的前提下,显著提升通用硬件上的运行速度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。