Skip to main content
QUICK REVIEW

[論文レビュー] Partition Pruning: Parallelization-Aware Pruning for Deep Neural Networks

Sina Shahhosseini, Ahmad Albaqsami|arXiv (Cornell University)|Jan 21, 2019
Advanced Neural Network Applications参考文献 23被引用数 6
ひとこと要約

本稿では、深層ニューラルネットワークの全結合層における並列化に配慮したプルーニング手法「Partition Pruning」を提案する。この手法により、モデルサイズの削減と推論速度の向上が達成される。プルーニングされた重み行列を複数のアクセラレータに分割して配置することで、微細調整後の精度損失を最小限に抑えつつ、TinyVGG16では1スルーレイタの非プルーニング推論と比較して7.72倍の高速化と2.73倍のエネルギー削減を達成した。

ABSTRACT

Parameters of recent neural networks require a huge amount of memory. These parameters are used by neural networks to perform machine learning tasks when processing inputs. To speed up inference, we develop Partition Pruning, an innovative scheme to reduce the parameters used while taking into consideration parallelization. We evaluated the performance and energy consumption of parallel inference of partitioned models, which showed a 7.72x speed up of performance and a 2.73x reduction in the energy used for computing pruned layers of TinyVGG16 in comparison to running the unpruned model on a single accelerator. In addition, our method showed a limited reduction some numbers in accuracy while partitioning fully connected layers.

研究の動機と目的

  • エッジデバイスにおける大型DNNの増大するメモリとエネルギー消費を低減すること。
  • スマートなプルーニングによりスパarsityを活用し、オフチップメモリアクセスとエネルギー消費を削減すること。
  • 複数アクセラレータにわたるプルーニングとパーティショニングを共同設計することで、効率的な並列推論を可能にすること。
  • 微細調整と制約に基づくパーティショニングを用いることで、過剰なプルーニングに対しても高いモデル精度を維持すること。
  • ハードウェアに配慮した並列化を最適化することで、マルチコアアクセラレータシステムにおける性能とエネルギー効率を向上させること。

提案手法

  • 並列化、オフチップアクセスの削減、精度の保持のバランスを取るために、プルーニングを制約付き最適化問題として定式化する。
  • 重要度に基づくプルーニングを適用し、全結合層の重みの50–80%を削除する。
  • プルーニングされた重み行列を部分行列に分割し、複数のアクセラレータに分散配置して並列推論を実現する。
  • 負荷のバランスとアクセラレータ間の通信オーバーヘッドを最小限に抑えるために制約を課す。
  • プルーニング後に非プルーニング重みのみを微細調整し、精度回復を図る。TensorFlowとNumPyを用いて実装する。
  • gem5-Aladdinのサイクル単位の正確なシミュレータを用い、マルチアクセラレータ構成での性能とエネルギーを評価する。

実験結果

リサーチクエスチョン

  • RQ1全結合層のプルーニングとパーティショニングを併用することで、DNNの推論速度とエネルギー効率が向上するか?
  • RQ2パーティション数が、プルーニング・並列化DNN推論における精度損失と性能向上に与える影響は?
  • RQ3どの程度までプルーニングによってオフチップメモリアクセスが削減され、DNNアクセラレータのエネルギー効率が向上するか?
  • RQ4異なるプルーニング比とパーティショニング方式において、モデル圧縮と精度低下のトレードオフはどのように変化するか?
  • RQ5ハードウェア制限(例:バス混雑)が、パーティショニングされた環境における複数アクセラレータでのスケーリング性能に与える影響は?

主な発見

  • 3コアアクセラレータ上で実行した場合、Partition PruningはTinyVGG16の推論性能を、1コアの非プルーニングモデルと比較して7.72倍に高速化した。
  • マルチアクセラレータ実行下で、プルーニングされた層のエネルギー消費は2.73倍削減された。
  • 微細調整後、TinyVGG16の精度損失は、3パーティションで微細調整なしの10.59%から、微細調整ありの0.87%に低下した。
  • プルーニングによりモデルサイズはパーティション数に比例して削減され(例:2パーティションでは2倍)、アクセラレータ間での効率的な分散が可能になった。
  • 1つのDMAによるバス混雑が原因で、2アクセラレータでは理論的潜在能力に比べて1.8倍の高速化、3アクセラレータでは2.5倍に留まった。
  • パrameter数とオフチップメモリトラフィックを顕著に削減しながらも、高い精度を維持した。これは、効果的なハードウェアに配慮したモデル圧縮を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。