Skip to main content
QUICK REVIEW

[论文解读] Structural Pruning via Latency-Saliency Knapsack

Maying Shen, Hongxu Yin|arXiv (Cornell University)|Oct 13, 2022
Advanced Neural Network Applications被引用 10
一句话总结

本文提出硬件感知延迟剪枝(HALP),一种结构化剪枝方法,通过增强的0-1背包求解器将网络剪枝建模为延迟约束下的资源分配问题。结合预计算的延迟查表与全局显著性分数,HALP能高效识别最优滤波器移除方案,在目标延迟预算下最大化模型准确率,在ImageNet和VOC基准测试中,针对多种模型和硬件平台均实现了最先进水平的准确率-延迟权衡。

ABSTRACT

Structural pruning can simplify network architecture and improve inference speed. We propose Hardware-Aware Latency Pruning (HALP) that formulates structural pruning as a global resource allocation optimization problem, aiming at maximizing the accuracy while constraining latency under a predefined budget on targeting device. For filter importance ranking, HALP leverages latency lookup table to track latency reduction potential and global saliency score to gauge accuracy drop. Both metrics can be evaluated very efficiently during pruning, allowing us to reformulate global structural pruning under a reward maximization problem given target constraint. This makes the problem solvable via our augmented knapsack solver, enabling HALP to surpass prior work in pruning efficacy and accuracy-efficiency trade-off. We examine HALP on both classification and detection tasks, over varying networks, on ImageNet and VOC datasets, on different platforms. In particular, for ResNet-50/-101 pruning on ImageNet, HALP improves network throughput by $1.60 imes$/$1.90 imes$ with $+0.3\%$/$-0.2\%$ top-1 accuracy changes, respectively. For SSD pruning on VOC, HALP improves throughput by $1.94 imes$ with only a $0.56$ mAP drop. HALP consistently outperforms prior art, sometimes by large margins. Project page at https://halp-neurips.github.io/.

研究动机与目标

  • 为解决在真实硬件约束下实现结构化神经网络剪枝的最优准确率-延迟权衡挑战。
  • 通过引入实际硬件延迟测量,克服基于FLOPs的剪枝方法的局限性,尤其针对具有非线性延迟特性的GPU平台。
  • 将全局结构化剪枝建模为约束优化问题,在目标硬件上满足预设延迟预算的同时最大化模型准确率。
  • 开发一种高效且可扩展的剪枝算法,同时尊重层间结构约束与硬件特定的延迟行为。
  • 在多种模型与数据集上,均实现优于现有剪枝方法的准确率与推理速度表现。

提出的方法

  • HALP在目标硬件上构建每层的延迟查表,以捕捉卷积层在不同通道数下呈现的非单调、阶梯状的延迟行为。
  • 为每个滤波器计算全局显著性分数,以估计其移除对模型准确率的影响,从而实现基于重要性的排序。
  • 将剪枝过程建模为在延迟预算下的奖励最大化问题,其中奖励为保留滤波器的显著性总和。
  • 使用增强的背包求解器选择滤波器,采用贪心近似策略以尊重层内顺序:仅当某一层中更重要的滤波器被保留时,才可保留其前序滤波器。
  • 求解器动态追踪在延迟约束下最优的滤波器保留组合,确保在硬件约束下实现最高准确率。
  • 该算法支持贪心与非贪心两种变体,实践中采用贪心版本,因其效率更高且性能相当。

实验结果

研究问题

  • RQ1我们能否通过建模硬件特定的延迟行为来改进结构化剪枝,而非依赖FLOPs作为代理指标?
  • RQ2如何在深层网络的所有层中,以全局、端到端的方式联合优化准确率与延迟?
  • RQ3层间结构约束对剪枝过程有何影响?如何高效地加以实施?
  • RQ4基于硬件感知延迟与显著性分数的背包公式是否在准确率与速度上优于现有剪枝方法?
  • RQ5在不同模型(如ResNet、SSD)与硬件平台上,剪枝性能在不同延迟预算下如何变化?

主要发现

  • 在ImageNet上,ResNet-50在1G延迟预算下,HALP实现77.45%的top-1准确率与1203 FPS,吞吐量提升1.60倍,准确率仅增加+0.3%。
  • 在相同1G延迟预算下,ResNet-101实现76.56%的top-1准确率与1672 FPS,吞吐量提升1.90倍,准确率仅下降-0.2%。
  • 在VOC上针对SSD,HALP实现1.94倍的吞吐量提升,mAP仅下降0.56,展现出在目标检测任务中的优异性能。
  • 非贪心背包求解器的准确率略高于贪心版本(如ResNet-50上为77.51% vs. 77.45%),但计算开销显著更高。
  • HALP在所有评估的模型、数据集与硬件平台上,持续优于先前最先进结构化剪枝方法。
  • 消融实验确认,延迟查表与基于显著性的排序均为实现最优准确率-延迟权衡的关键因素。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。