Skip to main content
QUICK REVIEW

[論文レビュー] DUNE Offline Computing Conceptual Design Report

The DUNE collaboration|arXiv (Cornell University)|Oct 28, 2022
Astrophysics and Cosmic Phenomena被引用数 4
ひとこと要約

この概念的設計レポートは、DUNEのオフライン計算インfraストラクチャを概説しており、分散コンピューティング、データ管理、ソフトウェアフレームワークを統合し、実験が発生させる膨大なデータ量を処理する。スケーラブルでクラウドおよびグリッド対応のシステムを提案し、Rucioをデータ管理に、ROOTおよびHDF5をデータフォーマットに、Kubernetesをオーケストレーションに使用することで、数ペタバイトに及ぶニュートリノ検出データを数十年にわたり効率的に処理・分析することが可能になる。

ABSTRACT

This document describes the conceptual design for the Offline Software and Computing for the Deep Underground Neutrino Experiment (DUNE). The goals of the experiment include 1) studying neutrino oscillations using a beam of neutrinos sent from Fermilab in Illinois to the Sanford Underground Research Facility (SURF) in Lead, South Dakota, 2) studying astrophysical neutrino sources and rare processes and 3) understanding the physics of neutrino interactions in matter. We describe the development of the computing infrastructure needed to achieve the physics goals of the experiment by storing, cataloging, reconstructing, simulating, and analyzing $\sim$ 30 PB of data/year from DUNE and its prototypes. Rather than prescribing particular algorithms, our goal is to provide resources that are flexible and accessible enough to support creative software solutions and advanced algorithms as HEP computing evolves. We describe the physics objectives, organization, use cases, and proposed technical solutions.

研究の動機と目的

  • DUNEのオペレーションライフタイムにわたりペタバイト規模のデータセットを生成する深地中ニュートリノ実験(DUNE)のための、堅牢でスケーラブルかつ拡張可能なオフライン計算インfraストラクチャを設計すること。
  • クラウド、HPC、グリッド施設を含む多様な計算リソースを統合することで、グローバルな共同作業において効率的なデータハンドリング、処理、分析を実現すること。
  • 確立されたヘプ(HEP)標準(例:ROOT、HDF5、FHiCL)に基づくモジュラーなソフトウェアスタックと、現代的なオーケストレーション(Kubernetes)を用いて、再現可能でパフォーマンスの高い分析ワークフローを支援すること。
  • RucioとMetaCatを用いたメタデータおよびデータ管理システムを実装し、分散サイト間でのプロバンセンス追跡、データ発見、アクセス制御を可能にすること。
  • コミュニティ標準に準拠し、FIFE、FTS3、dCacheなどの既存ツールを活用することで、他のヘプ実験と相互運用可能で長期的な持続可能性を確保すること。

提案手法

  • フェルミラブのNERSCおよびCERNの計算施設を含む、集中型と分散型のリソースを組み合わせたハイブリッドコンピューティングモデルを採用し、データ処理と分析を支援する。
  • グローバルサイト間で動的データ複製、場所追跡、アクセス制御を可能にするRucioをコアデータ管理サービスとして採用し、マルチティアのデータ管理システムを実装する。
  • データストレージと分析にROOTフレームワークを採用し、大規模な検出器シミュレーションおよび再構築ワークフローにおける効率的なI/Oおよび階層的データ構造化のため、HDF5を拡張して使用する。
  • 分析および処理ワークロードのポータブルでスケーラブルかつフェイルセーフなデプロイメントを実現するため、Kubernetesをコンテナオーケストレーションに使用する。
  • MetaCatによるプロバンセンス追跡を統合し、データラインレージ、ソフトウェアバージョン、処理パrameterを記録することで、再現性と監査可能性を確保する。
  • FIFE(フェルミラブの未来実験用インfraストラクチャ)を用いたジョブ送信およびワークフロー管理、FTS3を用いた安全で高スルーレートのデータ転送を統合する。

実験結果

リサーチクエスチョン

  • RQ1DUNEの20年以上にわたる運用期間にわたり予想されるペタバイト規模のデータ量を処理できる、グローバルに分散された計算インフラストラクチャは、どのようにアーキテクチャ設計されるべきか?
  • RQ2どのようなデータフォーマット、メタデータシステム、ストレージサービスの組み合わせが、多様な計算環境において効率的でスケーラブルかつ安全なデータ管理を実現するか?
  • RQ3Kubernetesなどの現代的なコンテナ化とオーケストレーションは、DUNEのオフラインソフトウェアスタックにどのように統合され、ポータビリティ、再現性、リソース利用効率を向上させるか?
  • RQ4ROOT、Rucio、FTS3などの確立されたヘプソフトウェアツールは、DUNE計算エコシステムの相互運用性と長期的持続可能性をどのように実現するか?
  • RQ5分散された分析および処理パイプライン全体にわたり、エンドツーエンドのデータプロバンセンスとワークフロー再現性をどのように保証するか?

主な発見

  • DUNEのオフライン計算システムは、実験の生涯にわたり100ペタバイトを超えるデータを管理することを設計しており、2040年までにデータ量が著しく増加すると予想される。
  • Rucioがコアデータ管理システムとして選定され、15か国以上にわたる国際的サイト間で動的データ複製、場所に依存するアクセス、ポリシー制御のデータ移動を可能にしている。
  • 主なデータフォーマットとしてHDF5とROOTが使用されており、HDF5はシミュレーションおよび再構築ワークフローにおける高速I/Oに、ROOTは分析および永続的ストレージに使用されている。
  • Kubernetesベースのオーケストレーションにより、分析および処理ワークロードのポータブルでスケーラブルかつ耐障害性の高いデプロイメントが実現され、運用の複雑さが軽減され、リソース利用効率が向上した。
  • MetaCatがメタデータカタログとして実装され、データプロバンセンス、ソフトウェアバージョン、処理パrameterの永続的かつ構造的な追跡を提供し、再現性を確保した。
  • FIFE、FTS3、dCacheの統合により、グローバルな計算施設間で安全で高スルーレートのデータ転送とジョブ送信が実現され、CMSおよびATLASの基準に準拠したパフォーマンスベンチマークが達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。