[論文レビュー] Sparse Allreduce: Efficient Scalable Communication for Power-Law Data
本稿では、パワー則に従うデータにおける分散機械学習のための通信最適化プリミティブであるSparse Allreduceを提案する。ハイブリッド・バタフライ-ラウンドロビンネットワークを用い、ネストされた通信と非均一なノード次数を組み合わせることで、スパースで特徴に配慮したデータ転送により通信オーバーヘッドを低減する。Hadoop や PowerGraph に対して最大10倍の高速化を達成する。
Many large datasets exhibit power-law statistics: The web graph, social networks, text data, click through data etc. Their adjacency graphs are termed natural graphs, and are known to be difficult to partition. As a consequence most distributed algorithms on these graphs are communication intensive. Many algorithms on natural graphs involve an Allreduce: a sum or average of partitioned data which is then shared back to the cluster nodes. Examples include PageRank, spectral partitioning, and many machine learning algorithms including regression, factor (topic) models, and clustering. In this paper we describe an efficient and scalable Allreduce primitive for power-law data. We point out scaling problems with existing butterfly and round-robin networks for Sparse Allreduce, and show that a hybrid approach improves on both. Furthermore, we show that Sparse Allreduce stages should be nested instead of cascaded (as in the dense case). And that the optimum throughput Allreduce network should be a butterfly of heterogeneous degree where degree decreases with depth into the network. Finally, a simple replication scheme is introduced to deal with node failures. We present experiments showing significant improvements over existing systems such as PowerGraph and Hadoop.
研究の動機と目的
- ウェブグラフ、ソーシャルネットワーク、テキストデータなどに一般的に見られるパワー則データセットにおける分散機械学習およびグラフアルゴリズムの通信ボトルネックを解消すること。
- 不要なデータ転送を最小限に抑えることで、不規則でスパースなデータに対するAllreduceのパフォーマンスを向上させること。
- スパース行列演算やPageRank、確率的勾配降下法といった反復的アルゴリズムに特化した、スケーラブルでフェイルセーフな通信プリミティブを設計すること。
- ネットワークトポロジーと通信パターンを最適化し、コンmodityクラスタ上での遅延低減とスループット向上を実現すること。
提案手法
- バタフライとラウンドロビン構造を組み合わせたハイブリッドネットワークトポロジーを提案し、スパースAllreduceにおける負荷分散と混雑の低減を実現する。
- 段階的な伝達の代わりにネストされた通信パターンを導入することで、通信ラウンド数を削減し、スケーラビリティを向上させる。
- 層ごとにノード次数を段階的に減少させる非均一なバタフライネットワークを設計し、パワー則データのスパarsity分布に適応させる。
- ノード障害に対処するためのリプリケーション方式を実装し、最小限のパフォーマンスオーバーヘッドで生産環境クラスタにおけるフェイルセーフ性を確保する。
- 各ノードが必要とする非ゼロ特徴量のみを通信することで、スパースデータ転送を実現し、全ベクトル集約を回避する。
- PageRank、スペクトルクラスタリング、ミニバッチSGDといった実世界のワークロードを用いて評価し、Hadoop、PowerGraph、GraphXと比較する。
実験結果
リサーチクエスチョン
- RQ1大規模機械学習におけるスパースでパワー則に従う分散データに対してAllreduceをどのように最適化し、通信オーバーヘッドを低減できるか?
- RQ2バタフライ、ラウンドロビン、またはハイブリッドトポロジーのうち、スパースAllreduceにおいて負荷分散とスループットのバランスが最良となるネットワークトポロジーは何か?
- RQ3段階的通信の代わりにネストされた通信ステージを採用することで、スパースAllreduceのパフォーマンスが向上するか?
- RQ4上位から下位へと層ごとに次数を減少させる非一様バタフライネットワークは、スケーラビリティの向上と遅延低減に寄与するか?
- RQ5実世界のグラフおよび機械学習ワークロードにおいて、Hadoop、PowerGraph、GraphXといった既存システムと比較して、提案されたSparse Allreduceのパフォーマンスはどの程度か?
主な発見
- Sparse Allreduce は非ゼロ特徴量のみを転送することで通信オーバーヘッドを低減し、大規模グラフワークロードにおいてHadoop や PowerGraph と比較して最大10倍の高速化を達成する。
- ハイブリッド・バタフライ-ラウンドロビンネットワークトポロジーは、純粋なバタフライまたはラウンドロビンネットワークよりも負荷分散と混雑の低減の両面で優れている。
- ネストされた通信ステージは、密行列Allreduceで用いられる段階的ステージと比較して通信ラウンド数を削減し、スケーラビリティを向上させる。
- 上位から下位へと層ごとに次数が減少する非一様バタフライネットワークは、パワー則データ分布に対して最適なスループットを達成する。
- Twitterのフォロワー関係グラフでは10回のPageRank反復を6秒で実行し、Yahooグラフでは23秒を記録し、Hadoop や PowerGraph を大きく上回るパフォーマンスを発揮する。
- 現在のパフォーマンスはJavaソケットの制限によって制限されているが、将来のRDMA(例:RoCE や Sockets Direct)統合によりさらなる向上が期待される。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。