Skip to main content
QUICK REVIEW

[論文レビュー] Distributed Matrix Multiplication Using Speed Adaptive Coding.

Krishna Giri Narra, Zhifeng Lin|arXiv (Cornell University)|Apr 15, 2019
Stochastic Gradient Optimization Techniques参考文献 40被引用数 4
ひとこと要約

本論文は、LSTMモデルを用いたリアルタイムの速度予測に基づき、高速および低速のノードに動的にワークロードを割り当てる速度適応型符号化計算フレームワーク $S^2C^2$ を提案する。分散行列乗算およびその他の線形代数ワークロードにおいて、レプリケーションおよび標準的な符号化計算と比較して、合計計算遅延を19%から39%まで短縮する。

ABSTRACT

While performing distributed computations in today's cloud-based platforms, execution speed variations among compute nodes can significantly reduce the performance and create bottlenecks like stragglers. Coded computation techniques leverage coding theory to inject computational redundancy and mitigate stragglers in distributed computations. In this paper, we propose a dynamic workload distribution strategy for coded computation called Slack Squeeze Coded Computation ($S^2C^2$). $S^2C^2$ squeezes the compute slack (i.e., overhead) that is built into the coded computing frameworks by efficiently assigning work for all fast and slow nodes according to their speeds and without needing to re-distribute data. We implement an LSTM-based speed prediction algorithm to predict speeds of compute nodes. We evaluate $S^2C^2$ on linear algebraic algorithms, gradient descent, graph ranking, and graph filtering algorithms. We demonstrate a 19% to 39% reduction in total computation latency using $S^2C^2$ compared to job replication and coded computation. We further show how $S^2C^2$ can be applied beyond linear algebra.

研究の動機と目的

  • クラウドベースの分散コンピューティング環境におけるスローワーサーバー(ストラグル)ノードによる性能ボトルネックを解消すること。
  • ノードの速度に基づいて知的に割り当てることで、従来の符号化計算フレームワークに内在する計算の余剰(スラック)を低減すること。
  • ワークロード再割り当て時にデータ再配布を必要としないため、動的で速度に配慮したタスク割り当てを活用して、その必要性を排除すること。
  • 符号化計算の適用範囲を線形代数にとどめず、勾配降下法、グラフランク、グラフフィルタリングなどのアルゴリズムへと拡張すること。
  • リアルタイムの速度予測と適応的ワークロード分配を通じて、エンドツーエンドの計算遅延を改善すること。

提案手法

  • リアルタイムで計算ノードの実行速度を推定するため、LSTMベースの速度予測モデルを採用する。
  • 予測された速度に基づいて、より速いノードに多くのタスクを、遅いノードに少ないタスクを割り当てる動的ワークロード分配戦略を設計する。
  • 速度予測を符号化計算フレームワークに統合し、冗長計算を最小限に抑え、全体の遅延を低減する。
  • データ再配布を必要とせずに、実際のノード性能に合わせたタスク割り当てにより、符号化フレームワークに内在する計算スラックを圧縮する。
  • 行列乗算、勾配降下法、グラフランク、グラフフィルタリングを含む多様な計算ワークロードに $S^2C^2$ フレームワークを適用する。
  • 合計計算時間を、ノード速度の変動に応じて最小化するように最適化するスラック圧縮メカニズムを採用する。

実験結果

リサーチクエスチョン

  • RQ1異種のノード速度が存在する状況下で、符号化計算フレームワークに内在する計算スラックを効果的に低減する方法は何か?
  • RQ2LSTMベースの速度予測は、分散行列乗算におけるワークロード分配の正確さを向上させ、全体の遅延を低減するのにどの程度効果的か?
  • RQ3$S^2C^2$ は、多様な計算ワークロードにおいて、ジョブレプリケーションおよび従来の符号化計算と比較してより低い遅延を達成できるか?
  • RQ4$S^2C^2$ の動的ワークロード割り当て戦略は、実行中にデータ再配布を必要とせずに、どのように機能するか?
  • RQ5$S^2C^2$ は、線形代数的計算を越えて、反復的およびグラフベースのアルゴリズムへと拡張可能か、その拡張性はどの程度か?

主な発見

  • 分散行列乗算において、$S^2C^2$ はジョブレプリケーションおよび従来の符号化計算と比較して、合計計算遅延を19%から39%まで短縮する。
  • LSTMベースの速度予測モデルにより、ノードの実行速度の正確な推定が可能となり、効果的なワークロードバランスが実現される。
  • リアルタイムの速度予測に基づく動的タスク割り当てにより、実行時におけるデータ再配布の必要性が完全に排除された。
  • $S^2C^2$ の性能向上効果は、勾配降下法、グラフランク、グラフフィルタリングアルゴリズムを含む多様なワークロードで一貫して観察される。
  • スラック圧縮メカニズムにより、無駄な待機時間と計算の重複が効果的に低減され、全体のシステム効率が向上する。
  • 提案手法は、線形代数を越えて反復的およびグラフベースの計算タスクへとスケーラブルかつ適応可能であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。