Skip to main content
QUICK REVIEW

[論文レビュー] Straggler-Resilient and Communication-Efficient Distributed Iterative Linear Solver

Farzin Haddadpour, Yaoqing Yang|arXiv (Cornell University)|Jun 15, 2018
Stochastic Gradient Optimization Techniques参考文献 37被引用数 13
ひとこと要約

本稿では、反復的線形ソルバとして、ストラグル(遅延)耐性かつ通信効率の高い分散型アルゴリズムであるPolyLinを提案する。この手法は、反復回数にかかわらず通信ラウンドをたった1回に削減する。誤り訂正符号の原理を活用することで、各ワーカーが並列に部分結果を計算でき、最大$P-K$個のストラグルを耐容可能となる。通信コストを著しく低減し、実験では計算オーバーヘッドが増加しても、最大20%の高速化を達成している。

ABSTRACT

We propose a novel distributed iterative linear inverse solver method. Our method, PolyLin, has significantly lower communication cost, both in terms of number of rounds as well as number of bits, in comparison with the state of the art at the cost of higher computational complexity and storage. Our algorithm also has a built-in resilience to straggling and faulty computation nodes. We develop a natural variant of our main algorithm that trades off communication cost for computational complexity. Our method is inspired by ideas in error correcting codes.

研究の動機と目的

  • 分散反復線形ソルバにおける通信ボトル neck とストラグル効果を解消すること。
  • 分散行列-ベクトル反復における通信ラウンド数と総データ転送量を削減すること。
  • 収束性能を損なわずに、ストラグルまたは故障したノードが存在する状況でも耐障害性を確保すること。
  • MRPolyLinを通じて、通信コストと計算複雑性のトレードオフを実現すること。
  • 通信を削減することで、ノードごとの計算量が増加しても、エンド・ツー・エンドの完了時間が短縮されることを実証すること。

提案手法

  • PolyLinは多項式補間と誤り訂正符号技術を用い、$n$ラウンドの通信を必要とせず、行列$\mathbf{A}$の$n$乗を計算する。
  • マスターノードは、$P$ 個のワーカーに符号化された入力をブロードキャストし、各ワーカーは$\mathbf{A}$と$\mathbf{Q}$の一部を用いて部分結果を計算する。
  • マスターノードは補間を用いて結果を集約し、1回の通信ラウンドで全$\mathbf{x}^{(n)}$を再構築可能となる。
  • 各ラウンドで$P$ 個のノードのうち$K$ 個以上が正常に処理を完了すれば、収束が保証され、ストラグル耐性が内蔵される。
  • MRPolyLinは反復処理を$\ell$ フェーズに分割し、通信コストとワーカーの計算負荷のトレードオフを実現する。
  • 各ワーカーノードでの事前処理では、1回の集中型反復に相当する多項式基底を計算し、複数のクエリにわたってコストを均等化できる。

実験結果

リサーチクエスチョン

  • RQ1分散反復線形ソルバが、線形収束を維持しながら1ラウンド通信を実現できるか?
  • RQ2誤り訂正符号の原理をどのように反復的行列計算における通信削減に応用できるか?
  • RQ3計算オーバーヘッドをどれだけ増加させれば、通信削減とストラグル耐性を達成できるか?
  • RQ4通信ラウンドを削減することで、ノード単位の計算量が増加しても、エンド・ツー・エンドの完了時間が短縮されるか?
  • RQ5すべての$P$ 個のノードが各ラウンドを完了する必要がないまま、$P-K$ 個のストラグルを耐容できるようにできるか?

主な発見

  • PolyLinは通信ラウンドを$n$ から1に削減し、各ワーカーあたりの総データ転送量は反復回数に依存せず約$2N$ ビットに抑えられる。
  • アルゴリズムは最大$P-K$ 個のストラグルを耐容可能であり、各ラウンドで$K$ 個の正常なノードが動作すれば正しく結果が得られる。
  • AWS EC2上で$N=168,000$ の環境で実験した結果、PolyLinおよびMRPolyLinは、同等の計算・ストレージコストを持つベースライン並列手法に比べ、最大20%の高速化を達成した。
  • 160個のノードのうち、速い110個または101個のノードの完了を待つ場合、MRPolyLinはすべてのノードが完了を要する手法に比べ、最大8%の高速化を達成した。
  • 事前処理コストは複数のクエリにわたって均等化されるため、$\mathbf{A}$ と$\mathbf{Q}$ が固定またはゆっくり変化するアプリケーション(例:パーソナライズドページランクやポissonソルバ)において実用的である。
  • MRPolyLinは、DSVRG や DASVRG とは異なり、通信量を$n^*$ に比例させないため、通信と計算の間で調整可能なトレードオフを実現可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。