Skip to main content
QUICK REVIEW

[論文レビュー] Improving Device-Edge Cooperative Inference of Deep Learning via 2-Step Pruning

Wenqi Shi, Yunzhong Hou|arXiv (Cornell University)|Mar 8, 2019
IoT and Edge/Fog Computing参考文献 13被引用数 13
ひとこと要約

本論文は、モバイルDNN推論におけるエンドツーエンド遅延を低減するために、モデル圧縮とデバイス-エッジ計算分割を統合最適化する2段階のプルーニングフレームワークを提案する。2段階の反復的プルーニング(まず計算負荷の削減、次に伝送負荷の削減)を経て、任意の損失なしPNGコーディングを追加することで、非プルーニング分割と比較して伝送負荷が最大25.6倍軽減され、合計計算が6.01倍高速化され、エンドツーエンド遅延が4.81倍低減される。特にWiFi環境下で顕著な効果を示す。

ABSTRACT

Deep neural networks (DNNs) are state-of-the-art solutions for many machine learning applications, and have been widely used on mobile devices. Running DNNs on resource-constrained mobile devices often requires the help from edge servers via computation offloading. However, offloading through a bandwidth-limited wireless link is non-trivial due to the tight interplay between the computation resources on mobile devices and wireless resources. Existing studies have focused on cooperative inference where DNN models are partitioned at different neural network layers, and the two parts are executed at the mobile device and the edge server, respectively. Since the output data size of a DNN layer can be larger than that of the raw data, offloading intermediate data between layers can suffer from high transmission latency under limited wireless bandwidth. In this paper, we propose an efficient and flexible 2-step pruning framework for DNN partition between mobile devices and edge servers. In our framework, the DNN model only needs to be pruned once in the training phase where unimportant convolutional filters are removed iteratively. By limiting the pruning region, our framework can greatly reduce either the wireless transmission workload of the device or the total computation workload. A series of pruned models are generated in the training phase, from which the framework can automatically select to satisfy varying latency and accuracy requirements. Furthermore, coding for the intermediate data is added to provide extra transmission workload reduction. Our experiments show that the proposed framework can achieve up to 25.6$ imes$ reduction on transmission workload, 6.01$ imes$ acceleration on total computation and 4.81$ imes$ reduction on end-to-end latency as compared to partitioning the original DNN model without pruning.

研究の動機と目的

  • 中間特徴マップのサイズが元のデータサイズを上回る場合に顕著な高伝送遅延と計算バランスの悪化を解消すること。
  • 帯域制限と遅延制限下でのモバイルDNN推論におけるエンドツーエンド遅延とエネルギー消費を低減すること。
  • システム状態(例:回線品質、遅延、精度要件)に応じて、プルーニング比と分割ポイントを柔軟かつ自動的に選択可能にすること。
  • 特徴量コーディングやイ早退出手法に比べ、プルーニングと圧縮を組み合わせることで、より優れた精度-遅延トレードオフを実現すること。
  • 精度損失なしに伝送オーバーヘッドをさらに低減できる、損失なしコーディング(例:PNG)と互換性を持つフレームワークを提供すること。

提案手法

  • 2段階の反復的チャネルプルーニングを実行するフレームワーク:ステップ1では、合計計算負荷を削減するためにフィルタをプルーニングする。ステップ2では、中間特徴マップのサイズを最小化して伝送負荷を削減する。
  • プルーニングは各層内で選択的に適用され、冗長なチャネルを低減することで、精度損失を最小限に抑えながらデータ量を削減する。
  • トレーニング中に異なる圧縮比を持つ複数のプルーディッドモデルが生成され、システム制約に応じたランタイムでの選択が可能になる。
  • 最大プーリング層の間で最適な分割ポイントを自動的に選択可能であり、4倍の空間ダウンサンプリングと低コストな計算が特徴のため、特に適している。
  • 分割ポイントでの中間特徴量に損失なしPNGコーディングを適用し、さらにデータを圧縮する。プルーニングによる冗長性の増加に伴い、その恩恵は段階的に小さくなる。
  • 本手法はVGGモデルを対象に評価され、非プルーニング分割のベースラインと、従来の特徴量コーディング手法(例:JPEGベース)と比較されている。

実験結果

リサーチクエスチョン

  • RQ12段階のプルーニング戦略は、デバイス-エッジDNN推論における計算負荷と伝送負荷の両方を効果的に低減できるか?
  • RQ2プルーニングと損失なしコーディング(例:PNG)の組み合わせは、精度を保持したまま伝送効率をどのように向上させるか?
  • RQ3さまざまな無線環境下でエンドツーエンド遅延を最小化する最適な分割ポイントは何か?
  • RQ4既存の特徴量コーディング技術と比較して、2段階プルーニングフレームワークは精度と遅延の両面で優れているか?
  • RQ5本フレームワークは、3G、4G、WiFiなどの異なるシステム制約にどの程度適応可能であり、高い精度を維持できるか?

主な発見

  • 2段階プルーニングフレームワークは、非プルーニングDNN分割と比較して、最大25.6倍の伝送負荷削減を達成した。
  • 両ステップでの効果的なフィルタプルーニングにより、合計計算負荷が6.01倍高速化された。
  • WiFi環境下ではエンドツーエンド遅延が最大4.81倍低減され、4Gでは3.69倍、3Gでは2.61倍の改善が得られた。
  • 高い圧縮比下でも精度損失が4%未満に抑えられ、JPEGベースの損失ありコーディング手法を上回った。
  • PNGコーディングにより、中間特徴量にさらに2倍の圧縮が可能となり、精度損失なしに効果的だった。特にプルーニングが中程度の状態で顕著な効果を示した。
  • バックエンドの最大プーリング層(例:Max Pool 3–5)は、プルーニングに対する感受性が低く、圧縮可能性が高いため、最も好ましい分割ポイントである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。