[論文レビュー] Pipeline Parallelism for Inference on Heterogeneous Edge Computing
EdgePipe は、計算能力、メモリ、ネットワーク帯域幅にばらつきのある異種エッジデバイス上で、精度を損なわずに大規模なビジョントランスフォーマー モデルの推論を高速化する分散推論フレームワークである。動的計画法に基づくパイプライン並列処理を用い、16デバイスのクラスタで最大 11.88× のスループット向上を達成している。
Deep neural networks with large model sizes achieve state-of-the-art results for tasks in computer vision (CV) and natural language processing (NLP). However, these large-scale models are too compute- or memory-intensive for resource-constrained edge devices. Prior works on parallel and distributed execution primarily focus on training -- rather than inference -- using homogeneous accelerators in data centers. We propose EdgePipe, a distributed framework for edge systems that uses pipeline parallelism to both speed up inference and enable running larger (and more accurate) models that otherwise cannot fit on single edge devices. EdgePipe achieves these results by using an optimal partition strategy that considers heterogeneity in compute, memory, and network bandwidth. Our empirical evaluation demonstrates that EdgePipe achieves $10.59 imes$ and $11.88 imes$ speedup using 16 edge devices for the ViT-Large and ViT-Huge models, respectively, with no accuracy loss. Similarly, EdgePipe improves ViT-Huge throughput by $3.93 imes$ over a 4-node baseline using 16 edge devices, which independently cannot fit the model in memory. Finally, we show up to $4.16 imes$ throughput improvement over the state-of-the-art PipeDream when using a heterogeneous set of devices.
研究の動機と目的
- メモリに収まらないリソース制限のある異種エッジデバイスに、大規模で高精度なビジョントランスフォーマー モデル(例:ViT-Large、ViT-Huge)をデプロイする課題に対処すること。
- 既存のパイプライン並列処理フレームワークは、均質なデータセンターを想定しており、計算能力、メモリ、ネットワーク帯域幅にばらつきのあるエッジ環境には最適化されていないという制限を克服すること。
- 計算能力、メモリ、ネットワーク帯域幅にばらつきのある異種エッジデバイス間で作業負荷を最適にバランスさせるパーティショニング戦略を開発し、推論スループットを最大化するとともに、モデルの精度を保持すること。
- 実際のエッジテストベッドにおいて、個々のデバイスが全モデルをメモリに保持できない状況を含め、パイプライン並列処理の有効性を実証すること。
提案手法
- 大規模ビジョントランスフォーマー モデルを複数の段階に分割し、それぞれを異なるエッジデバイスに割り当てるパイプライン並列処理を適用する。
- 計算能力、メモリ、ネットワーク帯域幅といった異種デバイスの特性を考慮した最適なパーティショニングマッピングを決定するために、動的計画法(DP)アルゴリズムを用いる。
- マイクロバッチ処理をモデル化し、計算と通信を重ねて実行することで、パイプラインの効率を向上させる。
- 各ワーカーが次の段階にのみ出力を送信する通信最適化されたデータフローを実装し、集合的同期を回避する。
- DeiT などのモデル圧縮技術と統合することで、さらなる性能向上を実現し、相乗効果を示す。
- MinnowBoard や RCC-VE ネットワーク ボードなどの多様なエッジデバイスを用いた実際のエッジテストベッドで評価し、現実的な条件下でのパフォーマンスを検証する。
実験結果
リサーチクエスチョン
- RQ1大規模ビジョントランスフォーマーの推論を、精度を損なわずに、異種エッジデバイスに効果的に適用できるか?
- RQ2エッジシステムにおける異種の計算能力、メモリ、ネットワーク帯域幅を考慮した場合、パイプライン並列処理の最適なパーティショニング戦略は何か?
- RQ3EdgePipe のパフォーマンスは、PipeDream や GPipe といった最先端のフレームワークと比較して、異種エッジ環境でどのように異なるか?
- RQ4パイプライン並列処理とモデル圧縮を組み合わせることで、エッジ推論のスループットをどの程度向上できるか?
- RQ5EdgePipe は、個々のエッジデバイスのメモリに収まらないモデルの推論を可能にするか?
主な発見
- ViT-Large と ViT-Huge モデルの両方において、16デバイスの均質クラスタで、それぞれ 10.59× および 11.88× のスループット向上を達成し、精度に損なわれはなかった。
- 個々のデバイスが ViT-Huge をメモリに収められない 4ノードのベースライン環境でも、16デバイスを用いることでスループットが 3.93× 向上した。
- 異種エッジデバイスを用いた環境では、PipeDream よりも最大 4.16× の高いスループットを達成した。
- 圧縮モデル(例:DeiT-Small、DeiT-Tiny)は EdgePipe と組み合わせることでさらに優れたスケーラビリティを示し、16デバイスで最大 17.23 イメージ/秒の性能を達成した。
- 動的計画法に基づくパーティショニング戦略は、異種デバイス間で作業負荷を効果的にバランスさせ、効率的なパイプライン実行を可能にした。
- パイプライン並列処理とモデル圧縮は相乗効果を示す:EdgePipe はモデル圧縮後でもスループットの向上を維持しており、両技術の相乗効果を実証した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。