Skip to main content
QUICK REVIEW

[論文レビュー] Structural Pruning via Latency-Saliency Knapsack

Maying Shen, Hongxu Yin|arXiv (Cornell University)|Oct 13, 2022
Advanced Neural Network Applications被引用数 10
ひとこと要約

本稿では、拡張されたナップサックソルバーを用いて、遅延制約付きリソース割り当て問題としてネットワーク prune を定式化する、ハードウェアに配慮した遅延 prune(HALP)を提案する。事前に計算された遅延ルックアップテーブルとグローバルな重要度スコアを組み合わせることで、ターゲット遅延予算内で最大の精度を達成する最適なフィルタ削除を効率的に特定し、複数のモデルとハードウェアプラットフォームにおいて ImageNet および VOC ベンチマークで最先端の精度-遅延トレードオフを達成する。

ABSTRACT

Structural pruning can simplify network architecture and improve inference speed. We propose Hardware-Aware Latency Pruning (HALP) that formulates structural pruning as a global resource allocation optimization problem, aiming at maximizing the accuracy while constraining latency under a predefined budget on targeting device. For filter importance ranking, HALP leverages latency lookup table to track latency reduction potential and global saliency score to gauge accuracy drop. Both metrics can be evaluated very efficiently during pruning, allowing us to reformulate global structural pruning under a reward maximization problem given target constraint. This makes the problem solvable via our augmented knapsack solver, enabling HALP to surpass prior work in pruning efficacy and accuracy-efficiency trade-off. We examine HALP on both classification and detection tasks, over varying networks, on ImageNet and VOC datasets, on different platforms. In particular, for ResNet-50/-101 pruning on ImageNet, HALP improves network throughput by $1.60 imes$/$1.90 imes$ with $+0.3\%$/$-0.2\%$ top-1 accuracy changes, respectively. For SSD pruning on VOC, HALP improves throughput by $1.94 imes$ with only a $0.56$ mAP drop. HALP consistently outperforms prior art, sometimes by large margins. Project page at https://halp-neurips.github.io/.

研究の動機と目的

  • 実際のハードウェア制約下での構造的ニューラルネットワーク prune における最適な精度-遅延トレードオフを達成する挑戦に応えること。
  • 特に GPU プラットフォームにおける非線形な遅延パターンを有する場合に、FLOPs を代理指標として用いる従来の prune 法の限界を乗り越え、実際のハードウェア遅延測定値を組み込むこと。
  • ターゲットハードウェア上の定められた遅延予算を尊重しつつ、モデル精度を最大化する制約付き最適化問題として、グローバルな構造的 prune を定式化すること。
  • レイヤー単位の構造的制約とハードウェア固有の遅延行動を尊重する、効率的でスケーラブルな prune アルゴリズムを開発すること。
  • 多様なモデルとデータセットにおいて、従来の prune 法を上回る精度と推論速度を達成すること。

提案手法

  • HALP は、ターゲットハードウェア上で各レイヤーの遅延ルックアップテーブルを構築し、チャネル数の変化に伴う非単調的で階段状の遅延挙動を捉える。
  • 各フィルタのグローバルな重要度スコアを計算することで、削除がモデル精度に与える影響を推定し、重要度に基づく順序付けを可能にする。
  • 本手法は、遅延予算内での報酬最大化問題として prune を定式化し、報酬は保持されたフィルタの累積的重要度として定義される。
  • 拡張されたナップサックソルバーを用いてフィルタを選択し、レイヤー内順序を尊重する貪欲な近似を採用:より重要なフィルタは、それより重要度が低いフィルタの前にのみ保持可能である。
  • ソルバーは遅延制約下で保持すべき最良のフィルタの組み合わせを動的に追跡し、ハードウェア制約下での最適な精度を保証する。
  • 本アルゴリズムは貪欲および非貪欲なバージョンをサポートしており、実用上は効率性と同等の性能を発揮するため、貪欲版が使用される。

実験結果

リサーチクエスチョン

  • RQ1FLOPs を代理指標として用いるのではなく、ハードウェア固有の遅延挙動をモデル化することで、構造的 prune を改善できるか?
  • RQ2深層ネットワークの全レイヤーにわたり、精度と遅延をグローバルかつエンドツーエンドで同時に最適化する方法は何か?
  • RQ3レイヤー単位の構造的制約が prune プロセスに与える影響は何か? また、それらは効率的に実装可能か?
  • RQ4ハードウェアに配慮した遅延と重要度スコアを組み合わせたナップサックベースの定式化は、従来の prune 法を上回る精度と速度を達成できるか?
  • RQ5異なるモデル(例:ResNet、SSD)およびハードウェアプラットフォームにおいて、さまざまな遅延予算下で prune の性能はどのように変化するか?

主な発見

  • 1G の遅延予算下での ImageNet における ResNet-50 では、HALP はトップ-1精度 77.45%、1203 FPS を達成し、スループットを 1.60× 向上させ、精度変化はわずか +0.3% にとどまる。
  • 同じ 1G の予算下での ResNet-101 では、HALP はトップ-1精度 76.56%、1672 FPS を達成し、スループットを 1.90× 向上させ、精度変化は -0.2% にとどまる。
  • VOC における SSD では、HALP がスループットを 1.94× 向上させ、mAP の低下はわずか 0.56 にとどまり、オブジェクト検出において優れた性能を示す。
  • 非貪欲なナップサックソルバーは貪欲版よりもわずかに高い精度(例:ResNet-50 では 77.51% 対 77.45%)を達成するが、計算コストが著しく高い。
  • HALP は、評価されたすべてのモデル、データセット、ハードウェアプラットフォームにおいて、先行する最先端の構造的 prune 法を一貫して上回る。
  • アブレーションスタディの結果、遅延ルックアップテーブルと重要度ベースの順序付けが、最適な精度-遅延トレードオフを達成するために両方とも不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。