Skip to main content
QUICK REVIEW

[論文レビュー] FTPipeHD: A Fault-Tolerant Pipeline-Parallel Distributed Training Framework for Heterogeneous Edge Devices

Yuhao Chen, Qianqian Yang|arXiv (Cornell University)|Oct 6, 2021
IoT and Edge/Fog Computing参考文献 39被引用数 4
ひとこと要約

FTPipeHD は、リアルタイムでのデバイス容量に基づいて動的にモデル分割を最適化し、定期的な重み再配布を用いてデバイス障害からの迅速な回復を可能にする、耐障害性がありパイプライン並列な分散学習フレームワークである。高レベルの非均一性下でも最先端の手法よりも 6.8 倍高速に学習を達成し、障害発生時でも性能を維持する。

ABSTRACT

With the increased penetration and proliferation of Internet of Things (IoT) devices, there is a growing trend towards distributing the power of deep learning (DL) across edge devices rather than centralizing it in the cloud. This development enables better privacy preservation, real-time responses, and user-specific models. To deploy deep and complex models to edge devices with limited resources, model partitioning of deep neural networks (DNN) model is necessary, and has been widely studied. However, most of the existing literature only considers distributing the inference model while still relying centralized cloud infrastructure to generate this model through training. In this paper, we propose FTPipeHD, a novel DNN training framework that trains DNN models across distributed heterogeneous devices with fault tolerance mechanism. To accelerate the training with time-varying computing power of each device, we optimize the partition points dynamically according to real-time computing capacities. We also propose a novel weight redistribution approach that replicates the weights to both the neighboring nodes and the central node periodically, which combats the failure of multiple devices during training while incurring limited communication cost. Our numerical results demonstrate that FTPipeHD is 6.8x faster in training than the state of the art method when the computing capacity of the best device is 10x greater than the worst one. It is also shown that the proposed method is able to accelerate the training even with the existence of device failures.

研究の動機と目的

  • IoT アプリケーションにおけるプライバシー、レイテンシ、パーソナライゼーションの損なわれることを避けるために、集中型クラウド学習の限界を解消すること。
  • リソース制限のあるエッジデバイス上で、複数の非均一デバイスに分散してディープニューラルネットワークのオンデバイス学習を可能にすること。
  • エッジ環境における動的なデバイス利用可能性と変動する計算能力の課題を克服すること。
  • 分散学習中のデバイス障害時において、通信コストを最小限に抑えた耐障害性を提供すること。
  • 隣接ノードおよび中央ノード間での動的モデル分割と効率的な重み複製を通じて、学習を加速すること。

提案手法

  • 各エッジデバイスの現在の計算能力に基づいて、リアルタイムでモデル分割ポイントを動的に調整し、ワークロードのバランスをとることで学習を加速する。
  • 隣接ワーカーおよび中央ノードに定期的(一定間隔)にモデル重みを複製する、新しい重み再配布メカニズムを導入する。
  • パイプライン並列を用いて、フォワードおよびバックワードパスを複数のデバイスに分散し、段階間で並列計算を可能にする。
  • チェーンレプリケーションとグローバルレプリケーションを用いて耐障害性を確保:デバイスが障害した場合、隣接および中央ノードが即座にそのワークロードを引き継げる。
  • バッチごとの送信ではなく、定期的なインターバルに制限することで、通信コストを最小限に抑える。
  • 過学習を回避しながら、エッジデバイス上で新規データを用いたインクリメンタルなモデル更新を可能にする、継続的学習をサポートする。

実験結果

リサーチクエスチョン

  • RQ1計算能力が時間とともに変化する非均一なエッジデバイス上で、分散 DNN 学習をどのように高速化できるか?
  • RQ2通信コストが著しく増大するのを防ぎつつ、パイプライン並列学習における耐障害性を確保するメカニズムは何か?
  • RQ3オンデバイス学習は、プライバシーを保ちながらリアルタイム推論を可能にすると同時に、モデル性能を維持できるか?
  • RQ4高いデバイス非均一性下で、動的モデル分割は学習速度をどの程度向上できるか?
  • RQ5提案された重み再配布方式は、性能劣化を最小限に抑えつつ、デバイス障害からの回復にどの程度効果的か?

主な発見

  • 最良のデバイスが最悪のデバイスの 10 倍高速な状況下で、FTPipeHD は最先端手法よりも 6.8 倍高速に学習を完了した。
  • デバイス障害発生後、FTPipeHD はわずか 2.24 秒の回復オーバーヘッドで学習を再開し、性能を維持した。一方、ResPipe は障害後 1 エポック分の学習に 59.18 分を要した。
  • FTPipeHD では障害回復後もバッチあたりの学習時間がほとんど変化しなかったが、ResPipe では学習時間が著しく増加し、その後も高い水準を維持した。
  • 提案された耐障害メカニズムにより、ResPipe よりも障害後の学習時間を 6.9 倍短縮し、実用的には回復コストが無視できる水準となった。
  • 3 台の Raspberry Pi デバイス上では、FTPipeHD が 10% のデータストリームを用いて継続的学習を成功させ、時間の経過とともに微調整前のモデル精度に回復した。
  • 単一デバイスでの学習は、メモリ制限のため 499 バッチ目で失敗した。これは、エッジデバイス上で分散学習が不可欠であることを裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。