Skip to main content
QUICK REVIEW

[論文レビュー] Combating Computational Heterogeneity in Large-Scale Distributed Computing via Work Exchange

Mohamed Adel Attia, Ravi Tandon|arXiv (Cornell University)|Nov 22, 2017
Cloud Computing and Resource Management参考文献 12被引用数 9
ひとこと要約

この論文は、大規模分散システムにおける計算の非均一性に対処するため、遅延するワーカーからの残余タスクを速いワーカーに動的に再割り当てすることで、無駄な待機時間と重複計算を最小限に抑える作業交換メカニズムを提案する。ワーカーの速度に関する事前知識がなくても、協調的オーバーヘッドが低く、理論的下限に非常に近い計算時間を達成する。

ABSTRACT

Owing to data-intensive large-scale applications, distributed computation systems have gained significant recent interest, due to their ability of running such tasks over a large number of commodity nodes in a time efficient manner. One of the major bottlenecks that adversely impacts the time efficiency is the computational heterogeneity of distributed nodes, often limiting the task completion time due to the slowest worker. In this paper, we first present a lower bound on the expected computation time based on the work-conservation principle. We then present our approach of work exchange to combat the latency problem, in which faster workers can be reassigned additional leftover computations that were originally assigned to slower workers. We present two variations of the work exchange approach: a) when the computational heterogeneity knowledge is known a priori; and b) when heterogeneity is unknown and is estimated in an online manner to assign tasks to distributed workers. As a baseline, we also present and analyze the use of an optimized Maximum Distance Separable (MDS) coded distributed computation scheme over heterogeneous nodes. Simulation results also compare the proposed approach of work exchange, the baseline MDS coded scheme and the lower bound obtained via work-conservation principle. We show that the work exchange scheme achieves time for computation which is very close to the lower bound with limited coordination and communication overhead even when the knowledge about heterogeneity levels is not available.

研究の動機と目的

  • 遅延ワーカー(ストラグル)が全体のタスク完了を遅らせる大規模分散システムにおける計算の非均一性の課題に対処すること。
  • 符号化計算(計算を無駄にする)やワークスティーリング(ワーカーを無駄に待機させる)といった従来手法の制限を克服すること。
  • 重複計算と無駄な待機時間を最小限に抑えつつ、計算時間の理論的下限に近づくスキームを開発すること。
  • 計算の非均一性が事前に分かっている場合と分かっていない場合の両方で、通信および協調的オーバーヘッドが低い効率的なタスク配分を可能にすること。

提案手法

  • 作業保存の原則に基づき、ワーカーの速度を基にした水補填最適化として解釈される、オラクルの計算時間下限を導出する。
  • マスターノードがリアルタイムの進行状況に基づき、遅いワーカーからの未完了サブタスクを速いワーカーに繰り返し再割り当てる作業交換フレームワークを提案する。
  • 2つのバージョンを実装:1つはワーカーの非均一性が事前に分かっている場合(事前計算されたタスク割り当てを使用)、もう1つはワーカー速度のオンライン推定を行う場合。
  • 再割り当ての反復回数を制限するカットオフしきい値を用い、通信オーバーヘッドを低減しながらも、低遅延を維持する。
  • タスクの分割を分割可能な作業単位としてモデル化し、非均一なノード間での柔軟な負荷分散を可能にする。
  • 非均一な非均一性の状況では、観測された完了時間に基づいて動的にワーカー速度を推定するフィードバックループを統合する。

実験結果

リサーチクエスチョン

  • RQ1非均一な分散システムにおいて、重複計算も無駄な待機もなければ、理論的最小計算時間は何か?
  • RQ2重複計算と待機時間を最小限に抑えつつ、この理論的下限に近づくスキームはどのように設計できるか?
  • RQ3このようなシステムにおいて、計算時間、協調的オーバーヘッド、通信オーバーヘッドのトレードオフは何か?
  • RQ4事前にワーカーの非均一性を知らない状況でも、作業交換メカニズムは近似的最適なパフォーマンスを達成できるか?

主な発見

  • 作業交換スキームは、ワーカーの非均一性が事前に分かっていない場合でも、オラクルの下限に極めて近い計算時間を達成する。
  • 非均一性が事前に分かっている場合には、初期タスク割り当てがすでに最適であるため、追加通信は無視できるほど少ない。
  • 非均一性が分からない状況では、ワーカー速度の分散が大きくなるに従い通信量が増加するが、全体として低く抑えられる。
  • 再割り当ての反復回数は非均一性の分散に比例して増加するが、カットオフしきい値により制御可能であり、性能を劣化させずに反復回数を削減できる。
  • 特に重複計算を回避する点で、高い非均一性の状況においてベースラインのMDS符号化計算よりも顕著に優れた性能を示す。
  • 計算が独立したサブタスクに分割できる限り、線形および非線形タスクの両方へ適用可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。