Skip to main content
QUICK REVIEW

[論文レビュー] Virtual Data in CMS Production

Adam Arbree, Paul Avery|ArXiv.org|May 31, 2003
Distributed and Parallel Computing Systems参考文献 7被引用数 15
ひとこと要約

本論文では、モンテカルロシミュレーションデータのCMSプロダクションワークフローにおけるGriPhyN Chimera仮想データシステムの統合を提示する。このシステムにより、分散グリッドリソース上で依存関係を考慮した自動化されたデータ処理が可能となり、高エネルギー物理学の複雑なワークロードにおいて最小限のユーザー介入で効率的かつスケーラブルなワークフロー実行が実現される。仮想データ言語、カタログ、および抽象的・具象的プランナを用いることで、論理的データ製品と物理的リソースを分離し、複雑な高エネルギー物理学ワークロードにおける効率的でスケーラブルなワークフロー実行を達成する。

ABSTRACT

Initial applications of the GriPhyN Chimera Virtual Data System have been performed within the context of CMS Production of Monte Carlo Simulated Data. The GriPhyN Chimera system consists of four primary components: 1) a Virtual Data Language, which is used to describe virtual data products, 2) a Virtual Data Catalog, which is used to store virtual data entries, 3) an Abstract Planner, which resolves all dependencies of a particular virtual data product and forms a location and existence independent plan, 4) a Concrete Planner, which maps an abstract, logical plan onto concrete, physical grid resources accounting for staging in/out files and publishing results to a replica location service. A CMS Workflow Planner, MCRunJob, is used to generate virtual data products using the Virtual Data Language. Subsequently, a prototype workflow manager, known as WorkRunner, is used to schedule the instantiation of virtual data products across a grid.

研究の動機と目的

  • CMSのような高エネルギー物理学実験における複雑でデータ集約的なワークロードの管理という課題に対処すること。
  • ユーザーが物理的ファイルの場所を追跡する必要がないように、分散グリッドリソース上でシームレスなデータ処理を可能にすること。
  • データ依存関係とリソース割り当ての抽象化により、ワークフロー管理における手動作業を削減すること。
  • モンテカルロシミュレーションにおける実際のCMSプロダクション環境で仮想データ抽象化の実現可能性を示すこと。
  • 大規模分散コンピューティングにおける科学的ワークフローのスケーラブルで自動化されたフレームワークを提供すること。

提案手法

  • ドメイン固有の仮想データ言語を用いて論理的データ要件を定義し、仮想データ製品を定義する。
  • 発見と管理を可能にするために、仮想データ記述を中央集権的な仮想データカタログに保存する。
  • 抽象プランナを用いて依存関係を解決し、場所に依存しない論理的実行計画を生成する。
  • 具象プランナを用いて抽象計画を物理的グリッドリソースにマッピングし、ファイルステージングとレプリケーションを処理する。
  • 仮想データ製品の生成を可能にするために、CMS MCRunJobワークフロー計画器とこのシステムを統合する。
  • プロトタイプのワークフロー管理ツールであるWorkRunnerを用いて、グリッド全体にわたる仮想データインスタンス化のスケジューリングと実行を行う。

実験結果

リサーチクエスチョン

  • RQ1仮想データ抽象化は、高エネルギー物理学における複雑でデータ集約的なワークロードの管理をどのように簡素化できるか?
  • RQ2論理的データ製品を物理的ストレージおよび実行場所から分離するために必要なメカニズムは何か?
  • RQ3仮想データシステムは、プロダクション規模のグリッド環境において、依存関係とリソース割り当てを効果的に管理できるか?
  • RQ4仮想データの使用は、分散データ処理ワークロードの管理におけるユーザーの負担をどのように軽減するか?
  • RQ5仮想データシステムは、実際のCMSプロダクションワークロードにおいて、どのようなパフォーマンスおよびスケーラビリティ特性を示すか?

主な発見

  • GriPhyN Chimeraシステムは、CMSモンテカルロプロダクションワークロードの自動的かつ依存関係を考慮した実行を成功裏に実現した。
  • 仮想データ抽象化により、ユーザーが物理的ファイルの場所を管理する必要なく、分散リソース上でシームレスなデータ処理が可能になった。
  • 抽象的および具象的プランニングレイヤーが、複雑な依存関係を効果的に解決し、論理的計画を物理的リソースにマッピングした。
  • MCRunJobおよびWorkRunnerとの統合により、実際のプロダクション環境における仮想データインスタンス化のエンドツーエンド自動化が実証された。
  • ワークフロー管理における手動介入が削減され、高エネルギー物理学のデータプロダクションにおけるスケーラビリティと再現性が向上した。
  • 本アプローチは、CHEP 2003会議での実世界のデプロイで検証され、プロダクション環境における実現可能性と実用性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。