[论文解读] Structured Deep Neural Network Pruning via Matrix Pivoting
该论文提出一种基于矩阵主元法的结构化剪枝方法,将深度神经网络的权重重构为排列-块-排列(PBP)形式,从而在边缘GPU上实现高效的稀疏矩阵-向量乘法。该方法在减少系数的同时实现近似线性加速,通过提升内存带宽利用率并支持硬件感知优化,优于厂商优化的库。
Deep Neural Networks (DNNs) are the key to the state-of-the-art machine vision, sensor fusion and audio/video signal processing. Unfortunately, their computation complexity and tight resource constraints on the Edge make them hard to leverage on mobile, embedded and IoT devices. Due to great diversity of Edge devices, DNN designers have to take into account the hardware platform and application requirements during network training. In this work we introduce pruning via matrix pivoting as a way to improve network pruning by compromising between the design flexibility of architecture-oblivious and performance efficiency of architecture-aware pruning, the two dominant techniques for obtaining resource-efficient DNNs. We also describe local and global network optimization techniques for efficient implementation of the resulting pruned networks. In combination, the proposed pruning and implementation result in close to linear speed up with the reduction of network coefficients during pruning.
研究动机与目标
- 解决在资源受限的边缘设备(如移动设备和物联网系统)上部署计算密集型深度神经网络(DNN)的挑战。
- 克服通用稀疏矩阵库在处理DNN剪枝中常见的中等稀疏度(5%–25%填充率)时的低效问题。
- 通过引入与硬件执行模式兼容的结构化稀疏性模型,弥合架构无关剪枝与架构感知优化之间的差距。
- 通过优化单层和多层全连接(FC)层,实现在现代嵌入式和移动GPU上的高效、低延迟推理。
- 证明通过矩阵主元实现的结构化稀疏性可在显著提升推理速度的同时保持模型精度
提出的方法
- 引入一种排列-块-排列(PBP)矩阵表示法,将稀疏权重矩阵重新组织为具有结构化稀疏性的块,以最小化不规则内存访问。
- 在剪枝过程中应用静态矩阵主元法,将任意稀疏权重矩阵转换为PBP形式,从而支持高效GPU执行。
- 针对单层全连接层设计局部优化策略,利用PBP结构减少内存访问开销。
- 开发多层编译器优化技术,保持连续全连接层之间的PBP结构,实现跨层内存访问合并。
- 实现针对现代GPU架构(如NVIDIA Jetson TX1和ARM Mali T880)定制的PBP格式稀疏矩阵-向量乘法(gemv)内核。
- 使用厂商优化库(cuBLAS、cuSPARSE、Arm Compute Library)作为性能对比基线
实验结果
研究问题
- RQ1通过矩阵主元实现的结构化稀疏性是否能在边缘GPU上实现DNN推理的近似线性加速,同时保持高模型精度?
- RQ2与标准稀疏格式(如CSR或BRC)相比,PBP表示法在内存带宽利用率方面有何改进?
- RQ3在小尺寸或高度稀疏的矩阵上,PBP转换中的排列开销在多大程度上影响性能?
- RQ4在真实边缘推理场景中,基于PBP的剪枝与优化策略是否能超越厂商优化的密集和稀疏线性代数库?
- RQ5在训练期间施加PBP结构是否会在标准视觉基准(如MNIST和CIFAR-10)上引起显著的精度下降?
主要发现
- 在NVIDIA Jetson TX1和ARM Mali T880上,PBP方法均实现了系数减少的近似线性加速,当矩阵大小为4096×4096、填充率为3.125%时,相比cuBLAS加速比达14.09倍,相比cuSPARSE加速比达9.26倍。
- 在Jetson TX1上,PBP gemv内核实现了100%的加载和存储效率,与密集矩阵乘法持平,而标准CSR格式仅实现12.5%的存储效率。
- 当填充率在6.25%–12.5%之间且矩阵大小≥128×128时,排列开销可忽略不计(≤内核执行时间的50%),表明该方法在典型全连接层稀疏度下具有实用性。
- 在MNIST上,PBP剪枝保持了原始网络100%的精度;在CIFAR-10上,精度下降控制在0.5%以内,表明性能损失极小。
- PBP形式在6.25%–25%填充率范围内显著优于厂商库,尤其在该范围内通用稀疏库因内存访问模式不佳而表现欠佳。
- 资源利用率测量显示,PBP内核在GPU上实现了100%的加载和存储效率,优于CSR(12.5%存储效率)和BRC(12.52%加载效率)格式
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。