Skip to main content
QUICK REVIEW

[論文レビュー] Coded TeraSort

Songze Li, Sucha Supittayapornpong|arXiv (Cornell University)|Feb 16, 2017
IoT and Edge/Fog Computing被引用数 4
ひとこと要約

Coded TeraSort は、データに構造的冗長性を導入することで、Hadoop MapReduce におけるデータシャッフルのボトルネックを軽減する新しい分散ソートアルゴリズムを提案する。ネットワーク内での符号化を可能にする。Amazon EC2 で評価した結果、通常のワークロードにおいて、従来の TeraSort と比較して 1.97x から 3.39x の高速化を達成した。

ABSTRACT

We focus on sorting, which is the building block of many machine learning algorithms, and propose a novel distributed sorting algorithm, named Coded TeraSort, which substantially improves the execution time of the TeraSort benchmark in Hadoop MapReduce. The key idea of Coded TeraSort is to impose structured redundancy in data, in order to enable in-network coding opportunities that overcome the data shuffling bottleneck of TeraSort. We empirically evaluate the performance of CodedTeraSort algorithm on Amazon EC2 clusters, and demonstrate that it achieves 1.97x - 3.39x speedup, compared with TeraSort, for typical settings of interest.

研究の動機と目的

  • Hadoop MapReduce フレームワークにおける大規模ソート処理におけるデータシャッフルのボトルネックを解消すること。
  • 分散ソートの標準ワークロードである TeraSort ベンチマークの性能を向上させること。
  • 正しく動作し、スケーラビリティを損なわずにネットワーク符号化の利点を活かせる符号化されたデータシャッフル機構を設計すること。
  • Amazon EC2 などの実世界のクラウド環境で、提案されたアルゴリズムの高速化を実証的に検証すること。

提案手法

  • MapReduce のシャッフルフェーズ中にネットワーク内符号化を可能にするために、入力データに構造的冗長性を導入する。
  • データパーティションを符号化パケットにマッピングする符号化方式を設計し、受信側が線形結合を用いて欠落したデータを復号できるようにする。
  • 従来のシャッフルを符号化シャッフルに置き換えることで、符号化されたデータ伝送を MapReduce パイプラインに統合する。
  • マップおよびリデュースインタフェースを保持することで、既存の Hadoop イフラストラクチャとの後方互換性を確保する。
  • シャッフル段階でランダム線形ネットワーク符号化の原則を用いて符号化パケットを生成し、送信総数を削減する。
  • 実世界のワークロードを用いて Amazon EC2 クラスタ上でアルゴリズムを評価し、エンドツーエンドのソート性能を測定する。

実験結果

リサーチクエスチョン

  • RQ1データに構造的冗長性を導入することで、MapReduce ソートにおけるデータシャッフルの通信コストを低減できるか?
  • RQ2TeraSort ワークロードでネットワーク内符号化を有効化することで、どの程度の性能向上が達成できるか?
  • RQ3クラウドベースの Hadoop クラスタにおけるエンドツーエンドのソート遅延に、符号化シャッフルがどのような影響を与えるか?
  • RQ4従来の TeraSort と比較して、さまざまなクラスタサイズおよびデータ量において、符号化アプローチはどのようにスケーリングするか?
  • RQ5提案手法は、標準の Hadoop MapReduce と互換性を保ちつつ、正しく動作し、性能を向上させることができるか?

主な発見

  • Coded TeraSort は、通常のワークロード下で Amazon EC2 クラスタ上において、従来の TeraSort と比較して 1.97x から 3.39x の高速化を達成した。
  • 性能向上の主な要因は、ネットワーク内符号化によって低減されたデータシャッフルのオーバーヘッドである。
  • 既存の Hadoop MapReduce フレームワークに低レベルの変更を加えることなく、互換性を維持したまま動作する。
  • 異なるクラスタサイズおよびデータ量においても、高速化が一貫して得られ、スケーラビリティが確認された。
  • 構造的冗長性の活用により、リデューサー ノードでの復号が効率的に行われ、計算オーバーヘッドを最小限に抑えることができた。
  • 実験結果から、符号化シャッフルがソートパイプラインのボトルネックを顕著に軽減することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。