Skip to main content
QUICK REVIEW

[论文解读] SparseRT: Accelerating Unstructured Sparsity on GPUs for Deep Learning Inference

Ziheng Wang|arXiv (Cornell University)|Aug 26, 2020
Advanced Neural Network Applications参考文献 42被引用 8
一句话总结

SparseRT 是一种代码生成器,通过利用 inspector-executor 框架来优化稀疏矩阵-密集矩阵乘法(SpMM),从而在 GPU 上加速深度学习推理中的非结构化稀疏性。对于 1x1 卷积和全连接层,其在 90% 稀疏度下实现了 3.4 倍的几何平均加速,在 95% 稀疏度下实现了 5.4 倍的几何平均加速,证明了非结构化稀疏性可以在通用 GPU 上被高效利用。

ABSTRACT

In recent years, there has been a flurry of research in deep neural network pruning and compression. Early approaches prune weights individually. However, it is difficult to take advantage of the resulting unstructured sparsity patterns on modern hardware like GPUs. As a result, pruning strategies which impose sparsity structures in the weights have become more popular. However,these structured pruning approaches typically lead to higher losses in accuracy than unstructured pruning. In this paper, we present SparseRT, a code generator that leverage unstructured sparsity to accelerate sparse linear algebra operations in deep learning inference on GPUs. For 1x1 convolutions and fully connected layers, we demonstrate geometric mean of speedups of 3.4x over the equivalent dense computation at 90% sparsity and 5.4x at 95% sparsity when evaluated on hundreds of test cases in deep learning. For sparse 3x3 convolutions, we show speedups of over 5x on use cases in ResNet-50.

研究动机与目标

  • 挑战一种普遍观点,即非结构化稀疏性在现代 GPU 硬件上支持不佳。
  • 解决现有 SpMM 实现中在深度学习中存在性能瓶颈的问题,这些实现原本针对极端稀疏性的科学计算进行了优化。
  • 通过通用 GPU 架构,实现剪枝后的深度神经网络在非结构化稀疏性下的高效推理。
  • 证明当搭配自定义优化内核时,非结构化剪枝既能保持精度又能实现高性能。

提出的方法

  • SparseRT 使用 inspector-executor 框架分析稀疏模式,并为 SpMM 操作生成优化的 PTX 内核。
  • 它从密集矩阵乘法开始,根据稀疏模式消除不必要的计算,避免依赖复杂的稀疏格式。
  • 该系统通过针对每层稀疏结构量身定制的 PTX 代码生成后端,生成自定义 CUDA 内核。
  • 通过 im2col 技术将稀疏的 3x3 卷积转换为 SpMM,从而实现加速。
  • 该方法在来自计算机视觉和自然语言处理的真实剪枝模型上进行了评估,包括 ResNet-50 和 BERT 类似架构。
  • 在数百个测试用例中,于不同稀疏度水平(90% 和 95%)下测量性能,以确保泛化能力。

实验结果

研究问题

  • RQ1非结构化稀疏性是否可以在无需专用硬件的情况下,在通用 GPU 上实现高效加速?
  • RQ2基于 inspector-executor 的代码生成技术在深度学习推理工作负载中的 SpMM 上效果如何?
  • RQ3在实际稀疏度水平(例如 90–95%)下,非结构化稀疏性可实现多大的性能提升?
  • RQ4SpMM 优化在剪枝网络中对 1x1 卷积和全连接层的推理速度提升有多大?
  • RQ5能否将稀疏卷积操作有效转化为 SpMM,同时仅造成最小的性能损失?

主要发现

  • 对于 1x1 卷积和全连接层,SparseRT 在 90% 稀疏度下相对于密集计算实现了 3.4 倍的几何平均加速。
  • 在 95% 稀疏度下,几何平均加速提升至 5.4 倍,表明其在更高稀疏度下具有良好的可扩展性。
  • 对于 ResNet-50 中的稀疏 3x3 卷积,该系统通过将操作简化为 SpMM 实现了最高 4 倍的加速。
  • 性能提升在来自计算机视觉和自然语言处理的真实剪枝模型的数百个测试矩阵中保持一致。
  • 结果挑战了当前普遍认为非结构化稀疏性与通用 GPU 架构不兼容的假设。
  • 研究表明,通过适当的代码生成与优化,非结构化稀疏性可以成为高效深度学习推理的可行路径。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。