Skip to main content
QUICK REVIEW

[論文レビュー] BLK-REW: A Unified Block-based DNN Pruning Framework using Reweighted Regularization Method

Xiaolong Ma, Zhengang Li|arXiv (Cornell University)|Jan 23, 2020
Advanced Neural Network Applications参考文献 25被引用数 11
ひとこと要約

本稿では、再重み付けグループラasso正則化を用いて、CNNおよびRNNの両方における構造的(pruning)を可能にする統合的ブロックベースDNN pruneフレームワーク、BLK-REWを提案する。柔軟なブロック単位の構造的スパarsityと、効率的な再重み付けメカニズムを導入することで、最小限の精度低下で高い圧縮率を達成し、統合されたコンパイラ最適化によりモバイルデバイスでのリアルタイム推論を実現する。

ABSTRACT

Accelerating DNN execution on various resource-limited computing platforms has been a long-standing problem. Prior works utilize l1-based group lasso or dynamic regularization such as ADMM to perform structured pruning on DNN models to leverage the parallel computing architectures. However, both of the pruning dimensions and pruning methods lack universality, which leads to degraded performance and limited applicability. To solve the problem, we propose a new block-based pruning framework that comprises a general and flexible structured pruning dimension as well as a powerful and efficient reweighted regularization method. Our framework is universal, which can be applied to both CNNs and RNNs, implying complete support for the two major kinds of computation-intensive layers (i.e., CONV and FC layers). To complete all aspects of the pruning-for-acceleration task, we also integrate compiler-based code optimization into our framework that can perform DNN inference in a real-time manner. To the best of our knowledge, it is the first time that the weight pruning framework achieves universal coverage for both CNNs and RNNs with real-time mobile acceleration and no accuracy compromise.

研究の動機と目的

  • 特定のネットワークタイプ(例:CNN)に限定された既存の構造的pruning手法における普遍性の欠如に対処すること。
  • ADMMベースのpruningにおける劣悪な解の品質と長時間の収束時間、特にRNNの全結合層において顕著な問題を克服すること。
  • CNNおよびRNNの両方で精度の低下を伴わずに、柔軟なpruning次元を実現すること。
  • コンパイラベースのコード最適化を統合し、リソース制限のあるモバイルプラットフォームでのリアルタイム推論を可能にすること。
  • 動的かつ効率的な正則化手法を用いて、最小限の精度損失で高いモデル圧縮を達成すること。

提案手法

  • 可変サイズのブロックに層を分割し、各ブロックごとに独立して構造的pruningを適用することで、設計の柔軟性を高めるブロックベース構造的pruning(BLK pruning)を導入する。
  • 重みの大きさに基づいて正則化強度を動的に調整する再重み付けグループラasso正則化法を採用し、より正確で効果的なスパarsity誘導を実現する。
  • 反復的に正則化ペナルティを更新する再重み付けスキームを用いることで、重要度の低い重みに焦点を当て、収束性とpruning品質を向上させる。
  • Winograd、TFLite、TVMなどのコンパイラ支援コード生成および最適化を統合し、モバイルCPUおよびGPUにおける推論を高速化する。
  • VGG-16やResNet-18などのCNNおよびTIMITでのGRUなどのRNNに、エンドツーエンドでフレームワークを適用し、畳み込み層および全結合層の両方をサポートする。
  • ブロック単位のスパarsity制約と再重み付け正則化を統合した統一されたトレーニングパイプラインを採用し、圧縮率と精度の両方を同時に最適化する。

実験結果

リサーチクエスチョン

  • RQ1統合的pruningフレームワークは、CNNおよびRNNの両方で高い圧縮率とリアルタイム推論を達成できるか?
  • RQ2再重み付け正則化は、従来のl1グループラassoおよびADMMに比べ、pruning品質と収束速度で優れているか?
  • RQ3ブロックベース構造的スパarsityは、高精度を維持しながら、ハードウェアに適合した効率的な推論を実現できるか?
  • RQ4コンパイラレベルの最適化統合が、prunedモデルの推論遅延にどのように影響するか?
  • RQ5本フレームワークは、モデル精度を損なわずに最先端の圧縮率を達成できるか?

主な発見

  • VGG-16では28.5倍の圧縮率を達成し、トップ1精度94.0%を維持。非構造的pruningと同等またはそれを上回る精度を達成しながら、ハードウェア互換性を保った。
  • ResNet-18では7.6倍の圧縮率を達成し、トップ1精度69.0%を維持。元のモデル性能の98.5%を保持。
  • MobileNet-V2では10.3倍の圧縮率を達成し、トップ1精度94.5%を達成。効率的アーキテクチャへの汎用性が顕著に示された。
  • GRUベース音声認識では231.3倍の圧縮率を達成し、テスト誤差率18.8%を記録。モバイルGPU上で0.21msの遅延でリアルタイム推論を実現。
  • モバイルCPU/GPU上での推論遅延は、画像分類タスクで33ms未満に抑えられ、リアルタイム要件(例:30fps動画)を満たした。
  • 再重み付け正則化法はADMMに比べて著しく収束が速く、特に全結合層においてl1グループラassoに比べて優れたスパarsityパターンを達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。