Skip to main content
QUICK REVIEW

[論文レビュー] Atlas Data-Challenge 1 on NorduGrid

P. Eerola, B. Kónya|arXiv (Cornell University)|Jun 2, 2003
Distributed and Parallel Computing Systems参考文献 2被引用数 8
ひとこと要約

本論文は、NorduGridがATLASデータチャレンジ1に成功裏に貢献したことを提示している。これは、グリッド上で実施されたLHCの最初の大規模なコンピューティング演習であり、スカンジナビアの物理学者らが1,000台のCPUを用いて2 TBを超える入力データを処理し、4,750件を超えるグリッドジョブを介して2.5 TBの出力データを生成した。軽量でポータブルなミドルウェアを用いて、動的ジョブブローカー、自動データ配布、および異種のクラスタ間でのストレージおよびレプリカカタログへのシームレスな統合を実現した。

ABSTRACT

The first LHC application ever to be executed in a computational Grid environment is the so-called ATLAS Data-Challenge 1, more specifically, the part assigned to the Scandinavian members of the ATLAS Collaboration. Taking advantage of the NorduGrid testbed and tools, physicists from Denmark, Norway and Sweden were able to participate in the overall exercise starting in July 2002 and continuing through the rest of 2002 and the first part of 2003 using solely the NorduGrid environment. This allowed to distribute input data over a wide area, and rely on the NorduGrid resource discovery mechanism to find an optimal cluster for job submission. During the whole Data-Challenge 1, more than 2 TB of input data was processed and more than 2.5 TB of output data was produced by more than 4750 Grid jobs.

研究の動機と目的

  • 実際のLHCデータ処理ワークロード下でのATLASコンピューティングモデルおよびソフトウェアスイートの妥当性を検証すること。
  • 生産規模の分散コンピューティング環境におけるグリッドミドルウェアの統合をテストすること。
  • スカンジナビアの異種コンピューティングセンターに跨る高エネルギー物理学ワークロードに、軽量でポータブルなミドルウェア(NorduGrid)を用いることが実現可能であることを示すこと。
  • 大規模かつ長時間にわたるワークロード下でのデータ配布、ジョブブローカー、リソース発見メカニズムの頑健性を評価すること。
  • 世界的なATLAS共同研究を支援し、スカンジナビアの機関がLHCの最初の主要なコンピューティングチャレンジに貢献できるようにすること。

提案手法

  • NorduGridの軽量でポータブルなグリッドミドルウェアを、スカンジナビアおよびフィンランドのスーパーコンピューティングセンターの1,000コアのCPUに最小限のシステム変更で展開した。
  • ジョブ要件(実行可能ファイル、引数、入力ファイル、ランタイム環境の依存関係など)を指定するためにxRSL言語を使用した。
  • NorduGrid情報システムおよびレプリカカタログを活用して、必要な入力データを保有する最適なクラスタを特定する動的ジョブブローカーを実装した。
  • グリッドマネージャを介した自動データ処理により、ストレージエレメントまたはレプリカカタログから入力ファイルを事前にダウンロードし、必要に応じてローカルにキャッシュした。
  • サイト管理者が管理するスクリプトを通じてランタイム環境を設定し、ジョブ実行前にソフトウェアパッケージ(例:ATLAS rpm)をセットアップできるようにした。
  • 外部ソース(ロシア、米国)から直接大容量の入力ファイルをNorduGridストレージエレメントに転送するため、ngcopyを用いてフェーズ3再構成を実行した。

実験結果

リサーチクエスチョン

  • RQ1軽量でポータブルなグリッドミドルウェアは、分散かつ異種の環境下で、複雑でデータ集約的な物理学ワークロードの実行を効果的に支援できるか?
  • RQ2動的リソース利用可能性を伴う広域グリッド上でのジョブブローカーおよびデータ配布の自動化は、どの程度効率的に行えるか?
  • RQ3複数フェーズに跨るシミュレーションおよび再構成処理において、マルチテラバイトのデータセットを処理する際、グリッドインfraストラクチャのスケーラビリティと信頼性の限界は何か?
  • RQ4外部データ依存性(例:ノイズデータベース)は、セキュアで空気ギャップ環境においてどのように扱えるか?
  • RQ5既存の非グリッドコンピューティングセンターは、大規模なインfraストラクチャの変更なしに、生産グリッドにどの程度統合可能か?

主な発見

  • NorduGridは、チャレンジ期間中に4,750件を超えるグリッドジョブを介して2 TBを超える入力データを処理し、2.5 TBを超える出力データを生成した。
  • 1,000コアのCPUが24時間365日稼働し、クラスタ間での動的負荷分散を実現した。この結果、高い信頼性とスケーラビリティを達成した。
  • レプリカカタログおよび自動データ取得の活用により、入力ファイルがローカルに存在しない場合でも、効率的なジョブ配置が可能だった。
  • ランタイム環境メカニズムにより、多様なクラスタ間で一貫したソフトウェアセットアップが実現され、複雑なATLASソフトウェアスタックの実行を可能にした。
  • 外部データ依存性(例:LArCalorimeterノイズデータベース)は、ローカルキャッシュを有効化することで処理され、空気ギャップ環境における接続性の問題が解決された。
  • NorduGridのミドルウェアはストレス状態下でも安定的かつ柔軟に動作し、スカンジナビア各地の複数のコンピューティングセンターでの採用が進んだ。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。