[论文解读] Partition Pruning: Parallelization-Aware Pruning for Deep Neural Networks
本文提出了一种名为分区剪枝(Partition Pruning)的方法,这是一种针对深度神经网络全连接层的并行化感知剪枝方法,可减少模型大小并加速推理。通过将剪枝后的权重矩阵分布在多个加速器上,与单加速器未剪枝推理相比,TinyVGG16 的推理速度提升了 7.72 倍,能耗降低了 2.73 倍,且微调后精度损失极小。
Parameters of recent neural networks require a huge amount of memory. These parameters are used by neural networks to perform machine learning tasks when processing inputs. To speed up inference, we develop Partition Pruning, an innovative scheme to reduce the parameters used while taking into consideration parallelization. We evaluated the performance and energy consumption of parallel inference of partitioned models, which showed a 7.72x speed up of performance and a 2.73x reduction in the energy used for computing pruned layers of TinyVGG16 in comparison to running the unpruned model on a single accelerator. In addition, our method showed a limited reduction some numbers in accuracy while partitioning fully connected layers.
研究动机与目标
- 应对边缘设备中大型深度神经网络(DNN)日益增长的内存与能耗需求。
- 通过智能剪枝利用稀疏性,减少对外部内存的访问次数与能耗。
- 通过在多个加速器上协同设计剪枝与分区策略,实现高效的并行推理。
- 通过微调与基于约束的分区策略,在极端剪枝下仍保持高模型精度。
- 针对硬件感知的并行化进行优化,提升多核加速器系统中的性能与能效。
提出的方法
- 将剪枝建模为带约束的优化问题,以平衡并行性、减少外部内存访问与精度保持之间的权衡。
- 采用基于权重大小的剪枝方法,移除 50%–80% 的全连接层权重,聚焦于移除重要性较低的连接。
- 将剪枝后的权重矩阵划分为子矩阵,并在多个加速器之间分发,以实现并行推理。
- 施加约束以确保负载均衡,并最小化加速器之间的通信开销。
- 剪枝后仅对未剪枝的权重进行微调以恢复精度,使用 TensorFlow 和 NumPy 实现。
- 利用 gem5-Aladdin 周期精确模拟器,在多加速器配置下评估性能与能耗。
实验结果
研究问题
- RQ1将全连接层剪枝与分区策略结合,是否能提升深度神经网络的推理速度与能效?
- RQ2分区数量如何影响剪枝后、并行化推理中模型的精度损失与性能增益?
- RQ3剪枝在多大程度上可减少对外部内存的访问,从而提升深度神经网络加速器的能效?
- RQ4在不同剪枝比例与分区方案下,模型压缩与精度下降之间的权衡关系如何?
- RQ5硬件限制(如总线拥塞)对分区架构中多加速器扩展性能有何影响?
主要发现
- 在三核加速器上运行时,与单核未剪枝模型相比,分区剪枝在 TinyVGG16 上实现了 7.72 倍的推理性能提升。
- 在多加速器执行下,分区剪枝使 TinyVGG16 中剪枝层的能耗降低了 2.73 倍。
- 微调后,TinyVGG16 的精度损失从 10.59%(3 个分区,无微调)降至 0.87%(3 个分区,含微调)。
- 剪枝使模型大小减小的倍数与分区数成正比(例如,两个分区时减小 2 倍),从而实现加速器间的高效分布。
- 由于仅有一个 DMA,总线拥塞限制了性能扩展,尽管理论潜力更高,但在两个加速器上仅实现 1.8 倍速度提升,在三个加速器上为 2.5 倍。
- 该方法在显著减少参数量与外部内存访问流量的同时,仍保持了高精度,证明了其在硬件感知模型压缩方面的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。