Skip to main content
QUICK REVIEW

[論文レビュー] Coalesced communication: a design pattern for complex parallel scientific software

Hywel B. Carver, Derek Groen|arXiv (Cornell University)|Oct 16, 2012
Parallel Computing and Optimization Techniques参考文献 4被引用数 4
ひとこと要約

本論文は、複雑な並列科学的ソフトウェアにおける通信オーバーヘッドを低減するための、複数のコンポonentからの通信リクエストを中央集権的かつ束ねる構造化されたアプローチであるコalesced通信デザインパターンを紹介する。ステップマネージャーと通信マネージャーを用いて計算と通信をオーバーラップすることで、ラティス・ボルツマン血液流れシミュレーションにおいて通信時間全体を約40%削減し、1024コアで全体のパフォーマンスを7%向上させた。

ABSTRACT

We present a new design pattern for high-performance parallel scientific software, named coalesced communication. This pattern allows for a structured way to improve the communication performance through coalescence of multiple communication needs using two communication management components. We apply the design pattern to several simulations of a lattice-Boltzmann blood flow solver with streaming visualisation which engenders a reduction in the communication overhead of approximately 40%.

研究の動機と目的

  • 高パフォーマンス並列科学的ソフトウェアにおける複雑化と通信非効率性に対処すること。
  • 複数の独立した通信リクエストが科学的コンポーネントにまたがって発生する場合に生じる同期ポイントの数を減らすこと。
  • 異なる機能モジュール間で計算と通信をオーバーラップさせることで、マルチフィジックスシミュレーションのパフォーマンスを向上させること。
  • 多様な通信ニーズを有するHPCアプリケーションに再利用可能な構造化されたデザインパターンを提供すること。
  • 本番レベルのHPCアプリケーションにおけるコalesced通信の有効性を実世界の事例で示すこと。

提案手法

  • 各コンポーネント(クライント)は、各実行ステップの開始時に、中央のステップマネージャーに通信ニーズを登録する。
  • ステップマネージャーは計算のコールバックをクライントに調整し、通信マネージャーはすべての非ブロッキングMPI呼び出しを管理する。
  • 複数のクライントからの通信リクエストが、1ステップあたり1つの同期ポイントに統合され、バリアの数が削減される。
  • 非ブロッキングMPI操作を用いることで、通信と計算をオーバーラップさせ、リソース利用効率を向上させる。
  • 受信データ用のバッファは事前に登録され、MPI wait呼び出しの成功後のみにアクセスされる。
  • 本設計は、コアカーネル、可視化、モニタリングモジュールをサポートするHemeLBラティス・ボルツマンシミュレーションフレームワークに実装されている。

実験結果

リサーチクエスチョン

  • RQ1中央集権的な通信管理パターンは、複雑な並列科学的アプリケーションにおける同期オーバーヘッドを低減できるか?
  • RQ2計算と通信をオーバーラップさせることで、マルチコンポーネントHPCシミュレーションのパフォーマンスはどの程度向上するか?
  • RQ3異なる機能コンポーネントからの複数通信リクエストを統合することで、通信時間全体はどの程度短縮できるか?
  • RQ4本番レベルの科学的シミュレーションで、このデザインパターンを用いることでどの程度のパフォーマンス向上が達成できるか?
  • RQ5可視化における画像レンダリング頻度の増加といった、通信負荷の増大に対しても、このパターンは効果的にスケーリングできるか?

主な発見

  • 1024コアでのHemeLBシミュレーションにおいて、コalesced通信パターンにより通信オーバーヘッドが約40%削減された。
  • 10枚の画像をレンダリングした場合、コalesced通信を有効化したことで、合計シミュレーション時間が29.3秒から27.6秒へ7%短縮された。
  • 1回の実行で200枚の画像をレンダリングした場合、1枚あたり0.0034秒のフレームレートを維持し、リアルタイムの可視化検査が可能であった。
  • 画像枚数が増えるにつれて、絶対的なパフォーマンス向上は増加したが、相対的な改善率はわずかに低下した。
  • 200枚の画像をレンダリングした際、通信時間は非統合時6.07秒から統合時3.82秒に低下した。
  • このパターンにより、計算と通信の有効なオーバーラップが実現され、1ステップあたりの同期ポイントが1つにまで削減された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。