Skip to main content
QUICK REVIEW

[論文レビュー] QPACE 2 and Domain Decomposition on the Intel Xeon Phi

Paul Arts, Jacques Bloch|arXiv (Cornell University)|Feb 13, 2015
Parallel Computing and Optimization Techniques参考文献 8被引用数 3
ひとこと要約

本稿では、高精度な格子QCDシミュレーションを目的とした、Intel Xeon Phiプロセッサを搭載したカスタムスーパーコンピュータ「QPACE 2」を提示する。ドメイン分解に基づくソルバを実装し、60コアでニアーリニアスケーリングを達成し、強スケーリングでは非DDソルバと比較して時間対解決が5倍速くなり、弱スケーリングでは2〜3倍速くなる。KNCアーキテクチャ上での優れた拡張性と効率性を示している。

ABSTRACT

We give an overview of QPACE 2, which is a custom-designed supercomputer based on Intel Xeon Phi processors, developed in a collaboration of Regensburg University and Eurotech. We give some general recommendations for how to write high-performance code for the Xeon Phi and then discuss our implementation of a domain-decomposition-based solver and present a number of benchmarks.

研究の動機と目的

  • 格子QCDシミュレーションを目的とした、コストおよびエネルギー効率に優れたスーパーコンピュータ「QPACE 2」を設計・展開すること。Intel Xeon Phi(Knights Corner)プロセッサを用いる。
  • 帯域幅制限型ソルバの限界を克服するため、よりレイテンシに強い耐性がありスケーラブルなドメイン分解(DD)プリコンディショナを実装すること。
  • Xeon Phiアーキテクチャ向けにハイパフォーマンスコンピューティングワークロードを最適化すること。特にメモリアクセスパターンと命令レベル並列性に焦点を当てる。
  • TACC StampedeクラスタをQPACE 2システムの代替として用い、マルチノード環境におけるDDソルバの強スケーリングおよび弱スケーリング挙動を評価すること。
  • より高い性能とメモリ帯域幅を備えたKnights Landing Xeon Phiアーキテクチャへのアップグレードを想定したQPACE 3の基盤を構築すること。

提案手法

  • QPACE 2は、4つのIntel Xeon Phi 7120Xプロセッサ、低消費電力CPU、およびデュアルポートFDR InfiniBandカードを搭載したカスタムノード設計を採用。PCIeスイッチを介して接続され、ピアツーピア通信を可能にしている。
  • PCIeおよびFDR InfiniBandを基盤とする2層構造のネットワークトポロジーを採用。低レイテンシと高帯域幅を実現し、効率的なノード間通信を可能にしている。
  • KNCのメモリ階層を考慮し、メモリ帯域幅の圧力を軽減し、スケーラビリティを向上させるドメイン分解に基づくソルバを実装している。
  • 最適化技術として、L1およびL2ソフトウェアプリファッチング、命令レベルチューニング(例:結合乗算加算命令の使用)、60個のKNCコアにわたる負荷バランスの最適化を実施している。
  • Intel VTuneを用いたプロファイル解析によりパフォーマンスを分析し、Gflop/s/コアおよび時間対解決といった主要メトリクスを、さまざまな格子サイズおよび構成で測定している。
  • マルチノードベンチマークは、TACC Stampedeクラスタを用い、7110P Xeon Phiバージョンを用いて、QPACE 2システム全体の挙動を模擬して実施している。

実験結果

リサーチクエスチョン

  • RQ1Xeon Phiアーキテクチャ上での強スケーリングおよび弱スケーリングにおいて、ドメイン分解プリコンディショナは非DDソルバと比べてどのように異なるか?
  • RQ2Xeon Phi 7120Xの単一コア性能に制限要因となる要因は何か。ソフトウェア最適化によりそれらをどのように緩和できるか?
  • RQ3KNCのメモリ階層およびキャッシュ動作が、格子QCDソルバのパフォーマンスに及ぼす影響はどの程度か?
  • RQ460個のKNCコアにドメインを分散する際、負荷の不均衡がマルチコアスケーリングに与える影響は何か。これを最小限に抑える戦略は何か?
  • RQ5実際のHMCおよびデータ解析ワークロードにおいて、DDソルバは非DDソルバに対してどの程度のパフォーマンス向上が見込まれるか?

主な発見

  • MR反復処理の単一コア性能は、単精度で13.3 Gflop/s/コアに達し、命令レベルのオーバヘッドとメモリスタールが性能上限(22 Gflop/s/コア)を制限している。
  • 全体のドメイン分解プリコンディショナは9.5 Gflop/s/コアを達成しており、主な性能損失は非MR部とメモリアクセスパターンに起因している。
  • ドメイン数が十分に多い場合、60コアでのDDソルバはほぼ線形スケーリングを達成するが、ドメイン数がコア数に近づくと負荷の不均衡が顕著になる。
  • 強スケーリングにおいて、DDソルバはTACC Stampedeクラスタ上で1024ノード(1024 KNC)まで線形スケーリングを維持し、非DDソルバと比較して5倍の高速化を達成した。
  • 弱スケーリングにおいて、DDソルバは非DDソルバを2〜3倍速く、大規模データ解析に適した性能を示している。
  • 1か月間の連続ベンチマークにおいてもシステムは安定して動作し、QPACE 2アーキテクチャの信頼性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。