Skip to main content
QUICK REVIEW

[論文レビュー] Running CMS software on GRID Testbeds

D. Bonacorsi, P. Capiluppi|arXiv (Cornell University)|Jun 4, 2003
Distributed and Parallel Computing Systems参考文献 6被引用数 6
ひとこと要約

この論文は、9つの分散サイトをカバーする大規模なストレステストを用いて、ヨーロッパデータグリッド(EDG)ミドルウェア上でCMSイベントシミュレーションソフトウェアの実行を評価している。高エネルギー物理学の複雑なワークロードをグリッドテストベッドで実行することが可能であることを示しており、500台を超えるCPUおよび5TBのディスク容量を活用した安定したジョブ実行を達成した。主な課題はミドルウェア統合およびデータ管理であり、共同でのチューニングと最適化によって解決された。

ABSTRACT

Starting in the middle of November 2002, the CMS experiment undertook an evaluation of the European DataGrid Project (EDG) middleware using its event simulation programs. A joint CMS-EDG task force performed a "stress test" by submitting a large number of jobs to many distributed sites. The EDG testbed was complemented with additional CMS-dedicated resources. A total of ~ 10000 jobs consisting of two different computational types were submitted from four different locations in Europe over a period of about one month. Nine sites were active, providing integrated resources of more than 500 CPUs and about 5 TB of disk space (with the additional use of two Mass Storage Systems). Descriptions of the adopted procedures, the problems encountered and the corresponding solutions are reported. Results and evaluations of the test, both from the CMS and the EDG perspectives, are described.

研究の動機と目的

  • CMSイベントシミュレーションソフトウェアを分散グリッド環境におけるEDGミドルウェア上で展開可能かどうかを評価すること。
  • 異種の計算およびストレージリソースを備えた複数のヨーロッパ拠点を対象とした、分散ジョブ実行の性能および安定性を評価すること。
  • 本番に近いグリッドテストベッド環境において、ジョブ送信、データ転送、リソース管理における技術的課題を特定および解決すること。
  • EDGミドルウェアスタックの高エネルギー物理学ワークロードに対する相互運用性およびスケーラビリティを検証すること。
  • 将来の本番グリッドインfraストラクチャへのCMSソフトウェア展開のベンチマークを提供すること。

提案手法

  • 4か所のヨーロッパ拠点から約10,000件のジョブを9つの分散サイトに送信することで大規模なストレステストを実施した。
  • EDGテストベッドリソースに加え、CMS専用の計算およびストレージ容量を組み合わせたハイブリッドインフラを活用した。
  • データ集約型のシミュレーションに必要な5TBのディスク容量を管理するために、2つのマスストレージシステムを採用した。
  • 多様なミドルウェア構成にわたり、CMS固有のイベントシミュレーションプログラムを用いた標準化されたジョブ送信ワークフローを実装した。
  • ボトルネックの特定およびパフォーマンス最適化のため、ジョブ実行、データ転送、リソース利用状況を監視した。
  • CMS-EDGタスクフォースによる共同作業を通じて、リアルタイムでミドルウェアおよび構成の問題を診断・解決した。

実験結果

リサーチクエスチョン

  • RQ1EDGミドルウェアを用いて、分散グリッドインフラ上でCMSイベントシミュレーションソフトウェアを信頼性高く実行できるか?
  • RQ2本番に近いグリッドテストベッドに複雑なHPCワークロードを展開するにあたり、主な技術的課題は何か?
  • RQ3多数の異種ジョブを複数のサイトにまたがって処理する際、EDGミドルウェアスタックのスケーラビリティはどの程度か?
  • RQ4複数サイトのグリッド環境において、データ転送およびストレージ管理の段階で顕在するパフォーマンスボトルネックは何か?
  • RQ5EDGミドルウェアは、CMSシミュレーションワークロードの計算およびストレージ要件をどの程度満たせるか?

主な発見

  • ストレステストにより、9か所のサイトにわたり約10,000件のジョブが正常に実行され、EDGミドルウェアがCMSワークロードにスケーラブルであることが実証された。
  • インフラは500台を超えるCPUおよび5TBのディスク容量を提供し、2つのマスストレージシステムを活用してデータの永続化が効果的に行われた。
  • CMS-EDGタスクフォースによる共同チューニングを通じて、ジョブスケジューリング、データ転送、ミドルウェア構成に関する主な問題が特定され解決された。
  • テストにより、信頼性およびパフォーマンスを満足する範囲で、分散グリッド環境上でCMSイベントシミュレーションソフトウェアを実行することが可能であることが確認された。
  • 本結果は、将来の本番グリッドインfraストラクチャへのCMSソフトウェア展開に向けた貴重な知見を提供し、EDGミドルウェアスタックがHPCワークロードに適していることを裏付けた。
  • CMSとEDGの共同評価プロセスにより、ミドルウェアの安定性および相互運用性が実用的な改善がなされた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。