Skip to main content
QUICK REVIEW

[論文レビュー] SPDY: Accurate Pruning with Speedup Guarantees

Elias Frantar, Dan Alistarh|arXiv (Cornell University)|Jan 31, 2022
Advanced Neural Network Applications被引用数 4
ひとこと要約

SPDYは、特定のハードウェア上で所望の推論速度向上を保証しつつ、精度損失を最小限に抑える最適なレイヤーごとのスパarsityプロファイルを自動的に決定する動的計画法に基づく手法を導入する。これは、効率的な動的計画法ソルバと局所探索手順を組み合わせ、少量のキャリブレーションデータからレイヤーごとの誤差スコアを学習することで、視覚および言語モデルにおけるワンショットおよび段階的 pruning において、従来の手法を上回る性能を発揮する。

ABSTRACT

The recent focus on the efficiency of deep neural networks (DNNs) has led to significant work on model compression approaches, of which weight pruning is one of the most popular. At the same time, there is rapidly-growing computational support for efficiently executing the unstructured-sparse models obtained via pruning. Yet, most existing pruning methods minimize just the number of remaining weights, i.e. the size of the model, rather than optimizing for inference time. We address this gap by introducing SPDY, a new compression method which automatically determines layer-wise sparsity targets achieving a desired inference speedup on a given system, while minimizing accuracy loss. SPDY is composed of two new techniques: the first is an efficient dynamic programming algorithm for solving the speedup-constrained layer-wise compression problem assuming a set of given layer-wise sensitivity scores; the second is a local search procedure for determining accurate layer-wise sensitivity scores. Experiments across popular vision and language models show that SPDY guarantees speedups while recovering higher accuracy relative to existing strategies, both for one-shot and gradual pruning scenarios, and is compatible with most existing pruning approaches. We also extend our approach to the recently-proposed task of pruning with very little data, where we achieve the best known accuracy recovery when pruning to the GPU-supported 2:4 sparsity pattern.

研究の動機と目的

  • 特定のハードウェア上で推論速度を最適化するのではなく、モデルサイズを最適化する従来の pruning 手法のギャップを埋める。
  • 所望の速度向上を保証しつつ、精度の低下を最小限に抑える、システムに適合した自動的なスパarsityプロファイル生成を可能にする。
  • ヒューリスティックまたは均一なスパarsity割り当ての限界を克服し、最小限のキャリブレーションデータからレイヤー固有の感受性スコアを学習する。
  • ワンショットおよび段階的 pruning と両立可能であり、低データおよび2:4スパarsity設定へも拡張可能であることを保証する。
  • 非構造的 pruning にとどまらず、量子化や低ランク近似などの他の圧縮技術へも一般化可能なフレームワークを提供する。

提案手法

  • レイヤーごとのスパarsity選択問題を、目標とする速度向上を達成しつつ精度損失を最小限に抑える制約付き最適化問題として定式化する。
  • レイヤー数および各レイヤーのスパarsity選択肢の数に対して線形時間計算量を達成する動的計画法アルゴリズムを提案し、制約付き圧縮問題の効率的かつ正確な解法を実現する。
  • 小規模なキャリブレーションセット上で再構築されたスパースモデルの性能を評価することで、自動的にレイヤーごとの誤差スコアを学習するための局所探索手順を導入する。
  • スパースモデルの再構築に、AdaPruneの変更版を用い、異なるスパarsityプロファイルの影響を正確に推定可能にする。
  • キャリブレーションデータ上のグローバルな pruning 行動を活用して、レイヤー間の相互作用を考慮した感受性スコアを推定し、個々のレイヤーに対するヒューリスティックに比べてより高いロバスト性を実現する。
  • FLOPs、エネルギー、パラメータ数などの任意の加法的制約(例:FLOPs、エネルギー、パラメータ数)をサポートすることで、速度向上を超えた拡張性を実現する。

実験結果

リサーチクエスチョン

  • RQ1特定のハードウェアプラットフォーム上で、特定の推論速度向上を保証するレイヤーごとのスパarsityレベルを自動的に決定する一般的な手法を開発可能か?
  • RQ2グローバルなネットワーク行動を捉え、標準的なヒューリスティック(例:重みの大きさ)よりも精度を向上させる方法で、レイヤーごとの誤差スコアを学習できるか?
  • RQ3提案手法は、多様なモデルおよび pruning モードにおいて、精度と速度向上の一貫性の面で、従来の pruning 策略を上回るか?
  • RQ4低データまたはポストトレーニング時の2:4スパarsity設定へも、強力な性能を発揮するように拡張可能か?
  • RQ5学習されたスパarsityプロファイルは、ワンショット vs. 段階的 pruning といった異なるトレーニングレジーム間でどれほど一般化可能か?

主な発見

  • SPDYは、ResNet50、YOLOv5m、BERTを含むすべてのテスト対象モデルにおいて、最先端のベースラインを上回る高い精度を達成し、特に高速化率が高い状況で顕著である。
  • YOLOv5mでは、2.00×の速度向上でmAP@0.5が61.50に達し、次善の手法よりも2.5ポイント以上優れている。
  • BERT SQuADでは、4.00×の速度向上でもF1スコアが87.14を維持し、次善の手法よりもF1ドロップの低減で1.4ポイント優位であった。
  • 同じ速度向上を達成する場合、均一またはGMP pruning よりも全体のモデルスパarsityを低く抑えているが、これは微調整後の精度が高くなる要因となっている可能性がある。
  • SPDYを中間のprunedモデルから繰り返し適用することで、さらなる精度向上が得られ、段階的改善の可能性を示唆している。
  • SPDYのプロファイルは良好に一般化される:AC/DCトレーニング済みモデルに対しても適用した場合、依然として優れた性能を発揮しており、ロットリートicketの原則に類似したアーキテクチャに依存した転送性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。