Skip to main content
QUICK REVIEW

[論文レビュー] MPI Benchmarking Revisited: Experimental Design and Reproducibility

Sascha Hunold, Alexandra Carpen-Amarie|arXiv (Cornell University)|May 28, 2015
Parallel Computing and Optimization Techniques参考文献 18被引用数 6
ひとこと要約

この論文は、時計およびプロセス同期を含む実験設計上の重要な問題を解決する統計的に妥当で再現可能なMPIベンチマーク手法を提案している。また、実行時間測定に影響を与える隠れた実験要因を同定している。著者らは、新規の時計同期アルゴリズムと厳密な統計的分析を導入することで、測定の分散を低減し、多様なスパコンアーキテクチャにおけるMPI実装同士の公平で繰り返し可能な比較を可能にした。

ABSTRACT

The Message Passing Interface (MPI) is the prevalent programming model used on today's supercomputers. Therefore, MPI library developers are looking for the best possible performance (shortest run-time) of individual MPI functions across many different supercomputer architectures. Several MPI benchmark suites have been developed to assess the performance of MPI implementations. Unfortunately, the outcome of these benchmarks is often neither reproducible nor statistically sound. To overcome these issues, we show which experimental factors have an impact on the run-time of blocking collective MPI operations and how to control them. We address the problem of process and clock synchronization in MPI benchmarks. Finally, we present a new experimental method that allows us to obtain reproducible and statistically sound MPI measurements.

研究の動機と目的

  • 既存のMPIベンチマーク手法における再現性および統計的妥当性の欠如に対処すること。
  • コンパイラフラグ、DVFS設定、mpirunコールなど、入力サイズやメッセージ長以外の要因がMPI実行時間測定に顕著に影響することを同定・制御すること。
  • MPIライブラリの性能比較を正確に、再現可能かつ統計的に妥当に行えるベンチマークフレームワークを開発すること。
  • 時計およびプロセス同期の改善により、MPIベンチマークにおける測定分散を低減すること。
  • 異種のスパコンシステム間でMPI性能を評価するための標準化され、証拠に基づいた方法を提供すること。

提案手法

  • プロセス間の時計ずれを考慮した新規の時計同期アルゴリズムを導入し、単なるオフセット補正を上回るタイミング精度を向上させた。
  • グローバルに同期された時計を用いたウィンドウベースの同期アプローチを採用し、MPI関数測定におけるタイミングジターミニマイズを実現した。
  • リンク順序や環境サイズなどの隠れた変数を制御するため、ランダム化された実験設計を適用した。
  • 非パラメトリック仮説検定(特にウィルコクソン符号順位検定)を用いて、MPI実装間の性能比較に耐性のある統計的推論を実施した。
  • 統計的信頼区間を用いてばらつきを評価し、信頼性を確保するためのマルチリピテーション測定スキームを実装した。
  • Grid’5000テストベッドを用いた妥当性評価により、既存のベンチマークと比較して分散が低減され、再現性が向上することを実証した。

実験結果

リサーチクエスチョン

  • RQ1時計およびプロセス同期手法は、MPIベンチマーク実行時間の正確性と再現性にどのように影響するか?
  • RQ2入力サイズやメッセージ長以外のどの実験要因が、MPI関数の性能測定に顕著に影響を与えるか?
  • RQ3同じ設定であっても、mpirunの呼び出し方そのものが測定された実行時間に顕著な影響を与える程度はどの程度か?
  • RQ4統計的に妥当なベンチマークフレームワークは、MPIパフォーマンス評価における測定分散を低減し、再現性を向上させることができるか?
  • RQ5非パラメトリック統計的検定は、第1種の誤り率を低く抑えながら、MPIライブラリの性能比較にどのように効果的に適用できるか?

主な発見

  • プロセス間の時計ずれは、特に短時間の処理において顕著なタイミング誤差を引き起こし、正確な測定のためには補正が必要である。
  • mpirunコマンド自体が重要な実験要因であることが判明した。同じベンチマークであっても、異なるmpirun呼び出し方によって、同じ設定下でも平均実行時間が顕著に異なる結果となった。
  • コンパイラフラグおよびDVFS設定がMPI関数の実行時間に測定可能な影響を与えることが判明し、実験条件の厳密な制御の必要性が強調された。
  • 提案手法により、実験全体における測定分散が低減され、既存のベンチマークスイートと比較してより再現性があり信頼性の高い性能比較が可能になった。
  • ウィルコクソン符号順位検定を用いた統計的分析により、MPI実装間の性能差に対する強い証拠が得られ、ベンチマーク比較の信頼性が向上した。
  • 新規の時計同期アルゴリズムは、時計ずれを考慮することで、従来の手法(例:Netgauge、SKaMPI)を上回る高精度を達成し、集約演算におけるタイミング誤差を低減した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。