Skip to main content
QUICK REVIEW

[論文レビュー] A New Combinatorial Design of Coded Distributed Computing

Nicholas Woolsey, Rong‐Rong Chen|arXiv (Cornell University)|Feb 12, 2018
Stochastic Gradient Optimization Techniques参考文献 4被引用数 3
ひとこと要約

本稿では、ハイパーキューブの組み合わせ設計に基づく新しい符号化分散コンピューティング方式を提案する。従来の手法と比較して、ノード数の増加に伴い指数関数的に増加する入力ファイル数およびマップ関数数を著しく削減する。構造的なファイル配置と符号化マルチキャストを活用することで、通信負荷を乗法的に削減する一方で、特定の条件下で近似的に最適な性能と漸近的最適性を維持する。

ABSTRACT

Coded distributed computing introduced by Li et al. in 2015 is an efficient approach to trade computing power to reduce the communication load in general distributed computing frameworks such as MapReduce. In particular, Li et al. show that increasing the computation load in the Map phase by a factor of $r$ can create coded multicasting opportunities to reduce the communication load in the Reduce phase by the same factor. However, there are two major limitations in practice. First, it requires an exponentially large number of input files (data batches) when the number of computing nodes gets large. Second, it forces every $s$ computing nodes to compute one Map function, which leads to a large number of Map functions required to achieve the promised gain. In this paper, we make an attempt to overcome these two limitations by proposing a novel coded distributed computing approach based on a combinatorial design. We demonstrate that when the number of computing nodes becomes large, 1) the proposed approach requires an exponentially less number of input files; 2) the required number of Map functions is also reduced exponentially. Meanwhile, the resulting computation-communication trade-off maintains the multiplicative gain compared to conventional uncoded unicast and achieves the information theoretic lower bound asymmetrically for some system parameters.

研究の動機と目的

  • ノード数の増加に伴い指数関数的に増加する入力ファイル数およびマップ関数数の2大限界を解消すること。
  • 同じ計算-通信トレードオフの利得を達成するために必要な入力ファイル数およびマップ関数数を削減すること。
  • 符号化されていないユニキャストと比較して、通信負荷に乗法的削減を維持すること。
  • 特定のパrameter領域(例:s=1 および s=2)において、情報理論的最適性を漸近的に達成すること。
  • 著しく少ないシステムリソースで実現可能なスケーラブルな方式を設計すること。

提案手法

  • 方式は、ハイパーキューブに基づく組み合わせ設計を用いて、ノード間でのファイル配置を構造化し、複数のノードが必要としている中間値が複数の場所でローカルに利用可能であることを保証する。
  • 各ノードは、割り当てられた出力関数に必要なみっつの中間値(マップ関数)のみを計算し、重複計算を回避する。
  • 符号化マルチキャストにより通信負荷を最小化し、各ノードは他のノードからの要求を満たすために、局所的に計算されたパケットのランダムな線形結合を送信する。
  • 方式は、パラメータ x, d, および η₁, η₂ を用いて形式化され、ノード数 K = xd、ファイル数 N = η₁x^d、関数数 Q = η₂xd が定義される。
  • 計算負荷 r_hc および通信負荷 L_hc は、二項係数および x のべき乗を含む組み合わせ的表現を用いて導出される。
  • 設計により、各中間値は s 個のノードから要求され、r 個のノードで計算可能となるため、効率的な符号化送信が可能になる。

実験結果

リサーチクエスチョン

  • RQ1ノード数の増加に伴い指数関数的に増加する入力ファイル数およびマップ関数数を削減できる符号化分散コンピューティング方式を設計できるか?
  • RQ2提案方式は、符号化されていないユニキャストと比較して、通信負荷に乗法的利得を維持するか?
  • RQ3s=1 や s=2 などの特定のシステムパrameter領域において、情報理論的最適性を達成できるか?
  • RQ4提案方式と従来手法とでは、システムサイズの増大に伴い、必要なファイル数および関数数がどのようにスケーリングするか?
  • RQ5提案されたハイパーキューブベースの設計における、計算負荷と通信負荷のトレードオフは何か?

主な発見

  • 提案方式により、必要な入力ファイル数 N は Κ choose r から (K/r)^r に削減され、大きな r に対してはファイル要件が指数関数的に削減される。
  • 必要なマップ関数数は Κ choose s から (K/s)^s に削減され、s が増加するにつれて指数関数的に減少する。
  • 通信負荷 L_hc は、符号化されていないユニキャストと比較して乗法的利得を達成し、K=9、r=14/9、s=3 の場合、L_hc = 20/27 となり、最適方式の L*=8/15 と比較して優れている。
  • s=1 の場合、r→∞ のとき情報理論的最適性を達成し、漸近的最適性を示している。
  • s=2 の場合、K→∞ のとき情報理論的最適性を達成し、この領域における漸近的最適性を確認している。
  • s=r が小さい場合、L_hc が理論的下界 L* から近く、近似的に最適な性能を維持している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。