Skip to main content
QUICK REVIEW

[論文レビュー] Restructuring, Pruning, and Adjustment of Deep Models for Parallel Distributed Inference

Afshin Abdi, Saeed Rashidi|arXiv (Cornell University)|Aug 19, 2020
Advanced Neural Network Applications参考文献 28被引用数 6
ひとこと要約

本稿では、並列分散推論におけるワーカー間依存を最小限に抑えるために事前学習済み深層ニューラルネットワークを再構築および剪定するフレームワークRePurposeを提案する。ℓ₀最適化とMunkres割り当てアルゴリズムを用いてニューロンの順序を再配置することで、通信および計算のオーバーヘッドを低減し、99%のスパarsityを達成したエッジシステムでは計算で最大11.01倍、通信で最大3.04倍の高速化を達成しながら、モデルの精度を維持する。

ABSTRACT

Using multiple nodes and parallel computing algorithms has become a principal tool to improve training and execution times of deep neural networks as well as effective collective intelligence in sensor networks. In this paper, we consider the parallel implementation of an already-trained deep model on multiple processing nodes (a.k.a. workers) where the deep model is divided into several parallel sub-models, each of which is executed by a worker. Since latency due to synchronization and data transfer among workers negatively impacts the performance of the parallel implementation, it is desirable to have minimum interdependency among parallel sub-models. To achieve this goal, we propose to rearrange the neurons in the neural network and partition them (without changing the general topology of the neural network), such that the interdependency among sub-models is minimized under the computations and communications constraints of the workers. We propose RePurpose, a layer-wise model restructuring and pruning technique that guarantees the performance of the overall parallelized model. To efficiently apply RePurpose, we propose an approach based on $\ell_0$ optimization and the Munkres assignment algorithm. We show that, compared to the existing methods, RePurpose significantly improves the efficiency of the distributed inference via parallel implementation, both in terms of communication and computational complexity.

研究の動機と目的

  • ワーカー間の同期とデータ転送遅延による分散ディープラーニングの性能劣化を是正すること。
  • 元のネットワークのトポロジーを変更せずに、分散推論環境における並列サブモデル間の相互依存を最小限に抑えること。
  • データセンターやリソース制限のあるセンサーネットワークを含む、異種プラットフォームへの事前学習済みモデルの効率的デプロイを可能にすること。
  • 構造的なニューロン再編成と剪定を通じて、モデル精度を維持しつつ、分散推論における通信および計算のオーバーヘッドを低減すること。

提案手法

  • RePurposeは、ℓ₀最適化を用いて冗長な接続を同定・削除することで、ワーカー間の依存を最小限に抑える層ごとの再構築を実行する。
  • Munkres割り当てアルゴリズムを用いてニューロンをワーカーに最適に割り当て、ワーカー間通信量を削減する。
  • ニューロンの重要度に基づく構造的剪定を適用し、パラメータ数を削減しながらモデル性能を保持する。
  • 元のネットワークトポロジーおよび一般的なアーキテクチャを維持するため、事前学習済みモデルの構造的変更を伴わない。
  • 50%、75%、90%、99%のさまざまなスパarsityレベルをサポートし、異なるハードウェア制約下での精度と効率のバランスを図る。
  • トレーニング後の最適化を想定しており、再トレーニングを必要とせず、多様なプラットフォームへのデプロイが可能である。

実験結果

リサーチクエスチョン

  • RQ1元のモデルのトポロジーを変更せずに、分散ディープニューラルネットワーク推論におけるワーカー間依存をどのように最小化できるか。
  • RQ2どのような最適化技術が、分散システムにおける通信および計算のオーバーヘッドを低減するために、事前学習済みモデルの再構築および剪定に効果的に適用できるか。
  • RQ3ニューロンの順序再配置および剪定は、データセンターおよびエッジ環境における推論速度をどの程度向上できるか。
  • RQ4RePurposeは、分散推論において通信および計算コストを顕著に削減しながら、どのようにモデル精度を維持できるか。

主な発見

  • データセンター環境では、99%のスパarsity(RP-99)を達成した場合、計算で最大10.47倍、通信で最大1.75倍の高速化を達成した。
  • エッジシステムでは、RP-99を用いることで、計算で最大11.01倍、通信で最大3.04倍の高速化が達成された。これは、ネットワーク帯域幅が低く、通信に高い感受性を示すためである。
  • モデルサイズが1Kから32Kニューロンに増加するに従い、エッジシステムにおける総合推論時間の改善は3.8倍に達し、通信が依然として主要要因のままである。
  • ワーカー数が増加するにつれて通信オーバーヘッドは上昇するが、その増加率は低下し、32ワーカーではベースラインの2倍に収束する。
  • 大規模モデル(N=1M)では、データセンター環境で計算がO(N²)スケーリングするため、総合時間は2.06倍に増加するが、通信はO(N)スケーリングする。
  • フレームワークは顕著な性能損失を維持せず、構造的再編成および剪定の影響にもかかわらず、精度が安定している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。