Skip to main content
QUICK REVIEW

[论文解读] Accelerating Sparse Deep Neural Networks

Asit Mishra, Jorge Albericio Latorre|arXiv (Cornell University)|Apr 16, 2021
Advanced Neural Network Applications参考文献 52被引用 14
一句话总结

本文提出一种2:4结构化稀疏模式,使NVIDIA Ampere GPU架构中的稀疏张量核心实现2倍的数学运算吞吐量。通过将密集模型剪枝至该结构化模式,并使用固定超参数进行一次微调,该方法在多种架构上保持了模型精度,同时实现了无需超参数调优的硬件加速推理。

ABSTRACT

As neural network model sizes have dramatically increased, so has the interest in various techniques to reduce their parameter counts and accelerate their execution. An active area of research in this field is sparsity - encouraging zero values in parameters that can then be discarded from storage or computations. While most research focuses on high levels of sparsity, there are challenges in universally maintaining model accuracy as well as achieving significant speedups over modern matrix-math hardware. To make sparsity adoption practical, the NVIDIA Ampere GPU architecture introduces sparsity support in its matrix-math units, Tensor Cores. We present the design and behavior of Sparse Tensor Cores, which exploit a 2:4 (50%) sparsity pattern that leads to twice the math throughput of dense matrix units. We also describe a simple workflow for training networks that both satisfy 2:4 sparsity pattern requirements and maintain accuracy, verifying it on a wide range of common tasks and model architectures. This workflow makes it easy to prepare accurate models for efficient deployment on Sparse Tensor Cores.

研究动机与目标

  • 解决在稀疏深度神经网络中同时实现高模型精度与硬件加速的挑战。
  • 克服非结构化稀疏性无法利用现代GPU矩阵计算流水线的局限性。
  • 开发一种实用的、硬件感知的稀疏模式,实现显著加速且不损失精度。
  • 提供一种通用的训练工作流,通过使用固定超参数进行微调,在剪枝后保持精度。
  • 通过张量核心中的原生支持,实现现代GPU硬件上稀疏模型的高效部署。

提出的方法

  • 提出一种2:4结构化稀疏模式,即每组四个连续值中至少包含两个零,以实现高效的硬件压缩与计算。
  • 设计一种压缩存储格式,以高效表示内存中的2:4稀疏张量,降低带宽与存储需求。
  • 在NVIDIA Ampere GPU架构中引入稀疏张量核心,当第一个操作数为2:4稀疏时,GEMM运算的数学吞吐量提升2倍。
  • 开发两阶段训练工作流:首先使用基于重要性的标准剪枝已完全训练的密集模型;其次使用与原始训练相同的超参数对剪枝后的模型进行微调。
  • 在微调过程中强制应用2:4稀疏模式作为固定掩码,确保硬件兼容性,无需动态稀疏性或超参数搜索。
  • 将该工作流应用于多种模型,包括ResNet、EfficientNet、BERT和视觉Transformer,证明了精度的一致性保持。

实验结果

研究问题

  • RQ1能否设计一种结构化稀疏模式,使深度神经网络在实现高硬件利用率的同时保持高模型精度?
  • RQ2能否开发一种通用的训练工作流,在剪枝后不需超参数调优或重新优化即可保持模型精度?
  • RQ3通过稀疏张量核心实现的硬件加速在真实世界模型上能实现多大程度的性能提升,同时保持精度?
  • RQ4强制实施2:4稀疏模式是否能在现代GPU架构上实现显著加速,而不损失模型性能?
  • RQ5该训练工作流能否在无需修改的情况下普遍应用于多种架构和任务?

主要发现

  • 2:4结构化稀疏模式使NVIDIA稀疏张量核心在GEMM运算中实现2倍的数学吞吐量,直接加速DNN推理。
  • 所提出的微调工作流在多种架构(包括ResNet-50、EfficientNet-B0、BERT-Large和视觉Transformer)上保持了模型精度,且未更改任何超参数。
  • 在ResNet-50上,使用标准通道剪枝仅造成1.5%的精度损失,实现了2倍加速;但通过本方法的微调流程,精度完全恢复。
  • 对于BERT-Large,剪枝并微调后的模型在INT8量化后仍与密集模型精度相当,证明了其在混合精度推理下的鲁棒性。
  • 该方法在图像分类、目标检测和自然语言理解等多个任务上进行了实证验证,表现出一致的性能与精度。
  • 初步结果表明,使用相同2:4模式的激活剪枝也可行且不损失精度,表明其潜在应用范围可扩展至权重之外。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。