Skip to main content
QUICK REVIEW

[论文解读] Accelerating Sparse DNN Models without Hardware-Support via Tile-Wise Sparsity

Cong Guo, Bo Yang Hsueh|arXiv (Cornell University)|Aug 29, 2020
Tensor decomposition and applications参考文献 56被引用 13
一句话总结

本文提出了一种仅通过软件实现的块内(TW)稀疏性方法,可在不修改硬件的前提下,高效地在通用GPU上推理稀疏深度神经网络(DNN)。通过在GEMM运算中于块级别强制执行规则的稀疏模式,TW在实现全局不规则剪枝以保持高模型精度的同时,使GPU张量核心的推理速度相比密集模型最高提升1.95倍。

ABSTRACT

Network pruning can reduce the high computation cost of deep neural network (DNN) models. However, to maintain their accuracies, sparse models often carry randomly-distributed weights, leading to irregular computations. Consequently, sparse models cannot achieve meaningful speedup on commodity hardware (e.g., GPU) built for dense matrix computations. As such, prior works usually modify or design completely new sparsity-optimized architectures for exploiting sparsity. We propose an algorithm-software co-designed pruning method that achieves latency speedups on existing dense architectures. Our work builds upon the insight that the matrix multiplication generally breaks the large matrix into multiple smaller tiles for parallel execution. We propose a tiling-friendly "tile-wise" sparsity pattern, which maintains a regular pattern at the tile level for efficient execution but allows for irregular, arbitrary pruning at the global scale to maintain the high accuracy. We implement and evaluate the sparsity pattern on GPU tensor core, achieving a 1.95x speedup over the dense model.

研究动机与目标

  • 解决由于任意稀疏模式导致的不规则内存访问所引发的稀疏DNN在通用硬件上的性能瓶颈问题。
  • 在不修改架构的前提下,实现对现有密集GEMM加速器(如GPU张量核心)上剪枝DNN模型的高效加速。
  • 通过引入一种适配分块的稀疏模式,在保持全局不规则剪枝的同时,实现块级别的规则性,从而在模型精度与执行效率之间取得平衡。
  • 证明仅通过软件优化即可在标准硬件上实现显著的加速效果,避免对专用稀疏性优化加速器的依赖。

提出的方法

  • 该方法将大矩阵划分为较小的块以进行GEMM计算,通过在块级别强制实施稀疏性,以保持与现有密集GEMM内核的兼容性。
  • 基于集体重要性评分,在每个块内执行行/列剪枝,从而在块级别实现规则的计算模式,同时允许全局任意稀疏性。
  • 块大小控制精度与效率之间的权衡:较小的块允许更细粒度的剪枝(更接近逐元素稀疏性),而较大的块则施加更粗粒度的结构性剪枝。
  • 采用混合稀疏模式,在TW稀疏性基础上叠加细粒度的逐元素剪枝(1.5%的权重),以在极小开销下进一步提升精度。
  • 该方法在GPU张量核心上实现,使用标准GEMM内核,并默认启用转置和融合优化。
  • 该方法利用GPU中现有的并发性和内存访问模式,避免对微架构或底层编程接口的任何修改。

实验结果

研究问题

  • RQ1能否设计一种仅通过软件实现的稀疏模式,以在不修改硬件的前提下加速通用GPU上的稀疏DNN推理?
  • RQ2如何对稀疏性进行结构化设计,以在保持高模型精度的同时,实现在现有GEMM加速器上的高效执行?
  • RQ3在标准硬件上,块大小与稀疏模式之间最优的权衡关系是什么,以在精度与性能之间实现平衡?
  • RQ4结合块内稀疏性与逐元素稀疏性的混合稀疏模式,是否能以极小的性能代价进一步提升精度?

主要发现

  • 所提出的块内(TW)稀疏模式在Bert和NMT模型上,于GPU张量核心上实现了相比密集模型1.95倍的加速,稀疏度达75%,且精度下降不足3%。
  • 在相同稀疏度和精度条件下,Bert和NMT模型的端到端延迟分别降低了1.61倍和1.86倍。
  • 混合稀疏模式(结合TW与1.5%的逐元素剪枝)相比仅使用TW模式显著提升了模型精度,尤其在稀疏度分布不均的模型中效果更明显。
  • 块大小G=128在模型精度与执行效率之间提供了良好的平衡,能够有效利用GEMM硬件。
  • 该方法与现有平台(如TPU)兼容,前提是低层编程接口暴露了所需的中等规模GEMM操作(例如128×N×128)。
  • 该方法在多种DNN模型(包括BERT和神经机器翻译模型)上均保持了高性能,展现出广泛的适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。