Skip to main content
QUICK REVIEW

[論文レビュー] Lattice QCD Calculations on Commodity Clusters at DESY

A. Gellrich, D. Pop|ArXiv.org|Jun 12, 2003
Advanced Data Storage Technologies参考文献 3被引用数 3
ひとこと要約

この論文は、インテル・ペントリウム4 ゼオンプロセッサとマイリンネット接続を搭載した一般品PCクラスタを用いて、ウィルソン=デイリクス作用素とイven-odd前処理を用いた格子QCD計算における性能を評価している。最適化されたSSE2命令と効率的なMPI通信を組み合わせることで、これらのクラスタはマルチTflopsの性能を達成しており、大規模な格子場理論シミュレーションに実用的であることが示された。

ABSTRACT

Lattice Gauge Theory is an integral part of particle physics that requires high performance computing in the multi-Tflops regime. These requirements are motivated by the rich research program and the physics milestones to be reached by the lattice community. Over the last years the enormous gains in processor performance, memory bandwidth, and external I/O bandwidth for parallel applications have made commodity clusters exploiting PCs or workstations also suitable for large Lattice Gauge Theory applications. For more than one year two clusters have been operated at the two DESY sites in Hamburg and Zeuthen, consisting of 32 resp. 16 dual-CPU PCs, equipped with Intel Pentium 4 Xeon processors. Interconnection of the nodes is done by way of Myrinet. Linux was chosen as the operating system. In the course of the projects benchmark programs for architectural studies were developed. The performance of the Wilson-Dirac Operator (also in an even-odd preconditioned version) as the inner loop of the Lattice QCD (LQCD) algorithms plays the most important role in classifying the hardware basis to be used. Using the SIMD Streaming Extensions (SSE/SSE2) on Intel's Pentium 4 Xeon CPUs give promising results for both the single CPU and the parallel version. The parallel performance, in addition to the CPU power and the memory throughput, is nevertheless strongly influenced by the behavior of hardware components like the PC chip-set and the communication interfaces. The paper covers the physics motivation for using PC clusters as well as a system description, operating experiences, and benchmark results for various hardware.

研究の動機と目的

  • 大規模な格子QCDシミュレーションに必要なマルチTflops性能を満たす一般品PCクラスタの実現可能性を評価すること。
  • CPU、メモリ帯域幅、相互接続技術といったハードウェア部品が、格子QCDにおけるウィルソン=デイリクス作用素の性能に与える影響を評価すること。
  • MPIおよびSSE2最適化を用いたクラスタ上で、イブン-オッド前処理付きディラック作用素の性能をベンチマークすること。
  • Myrinet、ギガビットイーサーネット、InfiniBandといった異なる相互接続技術の通信効率および全体的な性能を比較すること。
  • コスト効率が良くスケーラブルなPCクラスタが、格子場理論分野における専用または商業用スーパーコンピュータの代替手段として有効であることを支援すること。

提案手法

  • デューストゥール・ハムブルクおよびツェウテンに所在する2つのPCクラスタ(それぞれ32ノードおよび16ノードのデュアルCPUノード)を構築し、インテル・ペントリウム4 ゼオンプロセッサとマイリンネット相互接続を採用した。
  • CPU上のSIMD並列処理を活用するため、C言語で実装されたイブン-オッド前処理付きウィルソン=デイリクス作用素に、インラインSSE2組み込み命令を適用した。
  • 分散メモリ並列処理にMPIを用い、格子を1次元のドメインに分割して各プロセスに割り当てた。
  • 通信時間と計算時間を別々に測定し、有効帯域幅およびノードあたりの性能を算出した。
  • 基準として標準的なLüscherコードを用い、並列化を簡素化する代わりにキャッシュ効率を多少損なうように変更した。
  • 非同期MPI通信(MPI_Isend / MPI_Irecv / MPI_Wait)を評価し、通信と計算を重ねて実行する性能向上を検討した。

実験結果

リサーチクエスチョン

  • RQ1標準部品を用いた一般品PCクラスタは、大規模な格子QCDシミュレーションに必要なマルチTflops性能を達成できるか?
  • RQ2SSE2ベクトル化およびCPUレベルの最適化は、格子QCDにおけるウィルソン=デイリクス作用素の性能にどのように影響するか?
  • RQ3相互接続技術(Myrinet、ギガビットイーサーネット、InfiniBand)は、並列格子QCDコードの全体的な性能にどの程度影響を与えるか?
  • RQ4チップセットおよびPCIバススルーブラインは、格子場理論アプリケーションにおける通信性能にどのように影響するか?
  • RQ5細粒度の通信パターンを持つ格子QCDコードにおいて、非同期MPI通信は性能向上に寄与するか?

主な発見

  • PCクラスタはマルチTflopsの性能に達しており、一般品ハードウェアが格子QCDの高い計算要件を満たせることを示した。
  • インテル・ペントリウム4 ゼオンCPUにおけるSSE2ベクトル化により、ウィルソン=デイリクス作用素の内部ループで顕著な性能向上が得られた。
  • 通信性能はチップセットおよび相互接続技術に強く依存しており、E7500チップセットとInfiniBandは、旧式または低速なインターフェースと比較して優れたスルーブラインを示した。
  • 非同期MPI通信により、通信と計算のオーバーラップが可能となり、特にParaStationのような最適化されたMPI実装では性能が向上した。
  • ベンチマークコードは1.7 GHzのペントリウム4で579 Mflopsを達成した(Lüscher元コードの880 Mflopsと比較)。これは、並列化の簡素化に伴うキャッシュ再利用の低下が主な要因であった。
  • データ交換の有効帯域幅は、96 × L³ / t_comm バイト/秒として計算され、性能スケーリングは通信時間と計算時間の両方に依存した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。