Skip to main content
QUICK REVIEW

[論文レビュー] Comparative Performance Analysis of Intel Xeon Phi, GPU, and CPU

George Teodoro, Tahsin Kurç|arXiv (Cornell University)|Nov 2, 2013
Advanced Neural Network Applications参考文献 33被引用数 13
ひとこと要約

この論文は、画像解析ワークロードにおけるIntel Xeon Phi (MIC)、GPU、CPUアーキテクチャの性能を比較し、データアクセスパターンと並列化戦略に注目する。不規則なメモリアクセスのシナリオではGPUがMICを上回る性能を示すが、規則的なアクセスパターンではMICがGPUと同等または上回る。協調的なタスクスケジューリングにより、3072個のCPUコアと192個のMICを備えた192ノードのクラスタで、1.29倍の性能向上が達成され、84%の効率性を達成した。

ABSTRACT

We investigate and characterize the performance of an important class of operations on GPUs and Many Integrated Core (MIC) architectures. Our work is motivated by applications that analyze low-dimensional spatial datasets captured by high resolution sensors, such as image datasets obtained from whole slide tissue specimens using microscopy image scanners. We identify the data access and computation patterns of operations in object segmentation and feature computation categories. We systematically implement and evaluate the performance of these core operations on modern CPUs, GPUs, and MIC systems for a microscopy image analysis application. Our results show that (1) the data access pattern and parallelization strategy employed by the operations strongly affect their performance. While the performance on a MIC of operations that perform regular data access is comparable or sometimes better than that on a GPU; (2) GPUs are significantly more efficient than MICs for operations and algorithms that irregularly access data. This is a result of the low performance of the latter when it comes to random data access; (3) adequate coordinated execution on MICs and CPUs using a performance aware task scheduling strategy improves about 1.29x over a first-come-first-served strategy. The example application attained an efficiency of 84% in an execution with of 192 nodes (3072 CPU cores and 192 MICs).

研究の動機と目的

  • CPU、GPU、Intel Xeon Phi (MIC)アーキテクチャにおける主要な画像解析演算の性能を評価・特徴づけること。
  • データアクセスパターンと並列化戦略が、共プロセッサ間での性能に与える影響を特定すること。
  • 分散メモリシステムにおける、CPUとMICの協調実行を、パフォーマンスに配慮したタスクスケジューリングを用いて調査すること。
  • 演算の特性に基づいて、アプリケーション開発者が最適な共プロセッサを選択するための指針を提供すること。
  • ハイブリッドCPU-MICクラスタを用いた実世界のデジタル病理学アプリケーションにおいて、高いスケーラビリティと効率性を示すこと。

提案手法

  • CPU、GPU、MIC上でのコア画像解析演算(データクリーニング、オブジェクトセグメンテーション、特徴計算、集約、分類、登録)の体系的実装とベンチマーク。
  • データアクセスパターンに基づく演算の分類:規則的(例:スイープ)、不規則的(例:ランダムアクセス)、グローバル(例:還元)。
  • 共プロセッサの特性と演算の挙動を関連付けるために、マイクロカーネルのパフォーマンス測定を用いる。
  • CPUとMICの実行を最適化するパフォーマンスに配慮したタスクスケジューリング戦略の設計と評価。実行の停止時間と通信オーバーヘッドを最小限に抑えることを目的とする。
  • 192ノードのクラスタ(3072個のCPUコアと192個のMIC)上で実際のデジタル病理学アプリケーションを実行し、エンドツーエンドの効率性を測定。
  • 実行時間、スパイクアップ、スケーリング効率といった指標を用いて、アーキテクチャ間のパフォーマンスを比較。

実験結果

リサーチクエスチョン

  • RQ1異なるデータアクセスパターン(規則的対不規則的)が、GPU、CPU、MICのパフォーマンスに与える影響は何か?
  • RQ2Intel Xeon Phiは、GPUやCPUと比較して、どのような状況で優れるか、または劣るか?
  • RQ3CPUとMIC間の協調的タスクスケジューリングが、全体のアプリケーションパフォーマンスとスケーラビリティに与える影響は何か?
  • RQ4計算強度と並列化戦略が、共プロセッサタイプ間でのパフォーマンスポータビリティに与える影響は何か?
  • RQ5パフォーランスに配慮したスケジューリングは、画像解析ワークロードにおけるハイブリッドCPU-MICクラスタの効率性をどの程度向上させるか?

主な発見

  • 不規則なデータアクセスパターンを伴う演算では、特に頻繁なアトミック演算を含む場合、MICのランダムメモリアクセス性能が著しく劣るため、GPUがMICを顕著に上回る。
  • 規則的なデータアクセスと計算パターンを伴う演算では、MICのパフォーマンスはGPUと同等、あるいは場合によってはそれ以上である。
  • パフォーマンスに配慮したタスクスケジューリング戦略により、CPU-MICの協調実行において、最初来た順のスケジューリングに比べて1.29倍のパフォーマンス向上が達成された。
  • 例示されたデジタル病理学アプリケーションは、パフォーマンスに配慮したスケジューリング戦略を用いることで、3072個のCPUコアと192個のMICを備えた192ノードのクラスタで84%の効率性を達成した。
  • 計算とデータアクセスパターンの違いにより、演算ごとのパフォーマンスのばらつきが顕著に現れ、演算固有の共プロセッサ選択が不可欠である。
  • 本結果は、アクセスおよび計算特性に基づいて演算を最も適切な共プロセッサにマッピングするための実用的洞察をアプリケーション開発者に提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。