Skip to main content
QUICK REVIEW

[論文レビュー] High-throughput Execution of Hierarchical Analysis Pipelines on Hybrid Cluster Platforms

George Teodoro, Tony Pan|arXiv (Cornell University)|Sep 14, 2012
Distributed and Parallel Computing Systems参考文献 34被引用数 3
ひとこと要約

本論文では、バッグオブタスクと粗粒度データフロー実行の両方を組み合わせることで、クラスタープラットフォーム上で階層的データ分析パイプラインの高スループット実行を可能にするハイブリッドCPU-GPUランタイムミドルウェアを提示する。パフォーマンスに配慮したスケジューリング、データローカリティ最適化、非同期データ転送を活用し、100ノードで1秒間に150枚の画像タイルを処理する性能を達成。モノリシックまたは粗粒度アプローチに比べ顕著に優れた性能を発揮した。

ABSTRACT

We propose, implement, and experimentally evaluate a runtime middleware to support high-throughput execution on hybrid cluster machines of large-scale analysis applications. A hybrid cluster machine consists of computation nodes which have multiple CPUs and general purpose graphics processing units (GPUs). Our work targets scientific analysis applications in which datasets are processed in application-specific data chunks, and the processing of a data chunk is expressed as a hierarchical pipeline of operations. The proposed middleware system combines a bag-of-tasks style execution with coarse-grain dataflow execution. Data chunks and associated data processing pipelines are scheduled across cluster nodes using a demand driven approach, while within a node operations in a given pipeline instance are scheduled across CPUs and GPUs. The runtime system implements several optimizations, including performance aware task scheduling, architecture aware process placement, data locality conscious task assignment, and data prefetching and asynchronous data copy, to maximize utilization of the aggregate computing power of CPUs and GPUs and minimize data copy overheads. The application and performance benefits of the runtime middleware are demonstrated using an image analysis application, which is employed in a brain cancer study, on a state-of-the-art hybrid cluster in which each node has two 6-core CPUs and three GPUs. Our results show that implementing and scheduling application data processing as a set of fine-grain operations provide more opportunities for runtime optimizations and attain better performance than a coarser-grain, monolithic implementation. The proposed runtime system can achieve high-throughput processing of large datasets - we were able to process an image dataset consisting of 36,848 4Kx4K-pixel image tiles at about 150 tiles/second rate on 100 nodes.

研究の動機と目的

  • 大規模な科学的データ分析に向け、ハイブリッドCPU-GPUクラスターシステムを効率的に活用する課題に対処すること。
  • 異種のハードウェアにわたる細粒度で階層的なパイプライン実行を可能にすることで、データ集約的アプリケーションにおけるパフォーマンスとリソース利用効率を向上させること。
  • 知能的なスケジューリングとデータ管理技術を通じて、データ移動を最小限に抑え、GPUの利用効率を最大化すること。
  • 現代のハイブリッドクラスタアーキテクチャを活用して、テラバイトスケールの生体画像データセットを高スループットで処理する可能性を実証すること。
  • 将来的な複雑な分析パイプラインの段階に対応するため、MapReduceスタイルの処理を拡張すること。

提案手法

  • ミドルウェアは、ハイブリッドクラスターノードにわたるデータチャンクおよびパイプラインのスケジューリングのために、バッグオブタスクと粗粒度データフロー実行モデルを統合する。
  • リソースの可用性とパフォーマンス特性に基づいて動的にタスクを割り当てる、要請駆動型スケジューリング戦略を採用する。
  • パフォーマンスに配慮したタスクスケジューリングは、予測されたスケールアップ率に基づいて最適なCPUまたはGPU関数バージョンを選択し、ランタイムのオーバーヘッドを低減する。
  • アーキテクチャに配慮したプロセス配置により、各ノード内でのCPUおよびGPUへの演算の効率的マッピングを実現し、メモリおよび計算能力を考慮する。
  • データローカリティを配慮したタスク割り当てにより、計算とデータを同じ場所に配置することで、データ転送コストを最小限に抑える。
  • 非同期データコピーとプリフェッチによる、計算とデータ移動のオーバーラップを向上させ、アイドル時間を削減する。

実験結果

リサーチクエスチョン

  • RQ1ハイブリッドランタイムミドルウェアは、CPU-GPUクラスタープラットフォーム上で階層的分析パイプラインの高スループット実行を達成できるか?
  • RQ2細粒度パイプライン分解は、モノリシック実装と比較して、パフォーマンスおよびスケジューリングの柔軟性においてどのように異なるか?
  • RQ3パフォーマンスに配慮したスケジューリングとデータローカリティ最適化は、GPUの利用効率を向上させ、I/Oボトルネックをどれほど軽減できるか?
  • RQ4100台のハイブリッドクラスターノードにわたる本ミドルウェアのスケーラビリティは、大規模な画像分析ワークロードにおいてどの程度か?
  • RQ5非同期データ転送およびプリフェッチは、データ移動の遅延を隠すためにどの程度効果的か?

主な発見

  • 本システムは、膠芽腫(glioblastoma)研究から得た36,848枚の4K×4K画像タイルを処理する際、100ノードで1秒間に150枚の画像タイルの処理速度を達成した。
  • 100ノードで77%の効率を達成し、FCFSベースラインに比べ1.3倍のスループット向上を示した。主な制限要因は、高並列性下でのI/O競合に起因する。
  • 関数バージョンを用いたパフォーマンスに配慮したスケジューリングにより、不適切なCPU-GPUタスク割り当てを最小限に抑え、実行時間を短縮した。予測の不正確さがあっても、依然として効果的であった。
  • 細粒度パイプライン分解により、より優れたスケジューリングと最適化の機会が得られ、モノリシック実装に比べ顕著なパフォーマンス向上が達成された。
  • I/Oオーバーヘッドを除いた場合、理論的効率は93%に達し、スケジューリングおよび実行最適化のコア部分が極めて有効であることを示した。
  • 本システムは、テラバイトスケールのデータセットを4分未満で処理可能であるため、科学的問題の迅速な探索や感度分析の実現が可能であることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。