Skip to main content
QUICK REVIEW

[論文レビュー] SS-Auto: A Single-Shot, Automatic Structured Weight Pruning Framework of DNNs with Ultra-High Efficiency

Zhengang Li, Yifan Gong|arXiv (Cornell University)|Jan 23, 2020
Advanced Neural Network Applications参考文献 27被引用数 14
ひとこと要約

SS-Auto は、軟制約に基づく ADMM 定式化とプライマルプロキシマル解法を用いて、行と列の同時 pruning を行う、DNN におけるワンショットで自動的な構造的プルーニングフレームワークであり、VGG-16 で最大 41.1× の超高圧縮率を達成し、精度の低下を最小限に抑え、モバイルデバイスでの推論速度を顕著に向上させる。

ABSTRACT

Structured weight pruning is a representative model compression technique of DNNs for hardware efficiency and inference accelerations. Previous works in this area leave great space for improvement since sparse structures with combinations of different structured pruning schemes are not exploited fully and efficiently. To mitigate the limitations, we propose SS-Auto, a single-shot, automatic structured pruning framework that can achieve row pruning and column pruning simultaneously. We adopt soft constraint-based formulation to alleviate the strong non-convexity of l0-norm constraints used in state-of-the-art ADMM-based methods for faster convergence and fewer hyperparameters. Instead of solving the problem directly, a Primal-Proximal solution is proposed to avoid the pitfall of penalizing all weights equally, thereby enhancing the accuracy. Extensive experiments on CIFAR-10 and CIFAR-100 datasets demonstrate that the proposed framework can achieve ultra-high pruning rates while maintaining accuracy. Furthermore, significant inference speedup has been observed from the proposed framework through actual measurements on the smartphone.

研究の動機と目的

  • 強い非凸性と過剰なハイパーパrameterに依存する既存の ADMM に基づく構造的プルーニング手法の限界を解消する。
  • より豊かなスパース構造を探索し、圧縮効率を向上させるために、同時に行と列のプルーニングを可能にする。
  • 手動でのハイパーパrameterチューニングや非最適な設定を回避するため、各レイヤーごとのプルーニング率を自動で決定する。
  • プライマルプロキシマルアプローチにより勾配降下と正則化を分離することで、プルーニング中のモデル精度を向上させる。
  • 最小限の精度低下とモバイルプラットフォームでの測定可能な推論速度向上を達成する超高圧縮を実現する。

提案手法

  • ADMM における強い非凸性を持つ ℓ₀-ノルムのハード制約を、収束時間とハイパーパrameterへの感受性を低減する軟制約に基づく定式化に置き換える。
  • 勾配降下と正則化を分離するプライマルプロキシマル解法を導入し、重要度の低い重みに対して段階的にペナルティを低減可能にする。
  • 1回の最適化パスで行方向および列方向のスパarsity を同時に最適化し、フィルタとチャネルの共同プルーニングを可能にする。
  • 最適化プロセスを通じて各レイヤーごとのプルーニング率を自動で導出することで、手動チューニングを排除する。
  • コンパイラ支援のモバイル DNN 並列実行フレームワークを活用し、スマートフォンでの実世界の推論速度向上を測定する。
  • プロキシマル更新を用いた ADMM に基づく最適化により、モデル精度を維持したまま構造的プルーニング問題を効率的に解く。

実験結果

リサーチクエスチョン

  • RQ1ワンショットで自動的な構造的プルーニングフレームワークとして、行と列の同時最適化により、既存手法よりも高い圧縮率を達成できるか?
  • RQ2ADMM におけるハード ℓ₀-ノルム制約を軟制約に置き換えることで、収束速度が向上し、ハイパーパrameterへの感受性が低下するか?
  • RQ3プライマルプロキシマル解法により、プルーニング中にペナルティ重みを動的に調整することで、モデル精度が向上するか?
  • RQ4自動的な各レイヤーごとのプルーニング率決定は、手動または反復的なハイパーパramータ探索を上回る性能を発揮するか?
  • RQ5提案フレームワークを用いることで、実際のモバイルデバイスでどの程度の推論速度向上が達成できるか?

主な発見

  • VGG-16 において、SS-Auto は CIFAR-10 で 0.1% の精度低下で 41.1× の圧縮率を達成し、先行手法を上回る。
  • ResNet-18 では 24.6× の圧縮率と 94.2% の精度を達成し、AutoCompress (18.5×) や ADMM (15.1×) の手法を上回る。
  • MobileNet-V2 では精度に変化なしに 7.5× の圧縮率を達成し、アーキテクチャにかかわらず強い汎用性を示す。
  • CIFAR-10 の ResNet-18 において、CPU で 3.28ms、GPU で 3.39ms まで推論時間を短縮し、モバイルプラットフォームでの顕著な高速化を実現。
  • プライマルプロキシマル解法により、適応的なペナルティスケジューリングで重要な重みを保持することで、より正確なプルーニングが可能になる。
  • モバイルデバイスでの測定された推論速度向上は、特に高圧縮率下でのハードウェア効率の高さを裏付ける。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。