Skip to main content
QUICK REVIEW

[論文レビュー] Snowmass 2013 Computing Frontier Storage and Data Management

M. E Butler, R. Mount|arXiv (Cornell University)|Nov 18, 2013
Distributed and Parallel Computing Systems参考文献 4被引用数 3
ひとこと要約

本論文は、データ集積型の高エネルギー物理学(HEP)実験の運用負担を軽減するため、仮想データと最適化されたコスト効率の良いストレージ階層(テープ、ディスク、ソリッドステートストレージの活用)への移行を提唱する。LHC規模のシステムを模範としつつも、より広範な科学分野に適合させるための統合的で低コストのデータ管理フレームワークを提唱し、仮想データにより動的で需要駆動型のデータ生成と長期保存を可能にする。

ABSTRACT

The data storage and data management needs are summarized for the energy frontier, intensity frontier, cosmic frontier, lattice field theory, perturbative QCD and accelerator science. The outlook for data storage technologies and costs is then outlined, followed by a summary of the current state of data, software and physics analysis capability preservation. The HEP outlook is summarized, pointing out where future data volumes may strain against what is technologically and financially feasible. Finally recommendations for areas of particular attention and action are made.

研究の動機と目的

  • 高エネルギー物理学(HEP)実験におけるペタバイト規模のデータを保管・管理するコストと複雑さの増大に対処する。
  • 米国-ATLAS実験の単独で年間約450万ドルに上る、分散型データ管理システムの運用コストを削減する。
  • HEP分野の境界を越えて共通化されたインfra構築を進めるべく、長期的なデータ保存とオープンアクセスを可能にする、共有で標準化されたインfraストラクチャの開発を推進する。
  • 広範な科学分野や産業界と協働することで、HEPのデータ管理技術の相互運用性と再利用性を促進する。
  • 特にディスク容量の増加が鈍化する傾向にある中で、変化するストレージコストの動態に応じて柔軟かつ適応可能なコンピューティングモデルを設計する。

提案手法

  • データ製品が必要なまでに実行可能レシピとしてのみ存在する仮想データモデルを採用し、恒久的ストレージを最小限に抑える。
  • ストレージと再生成のコストトレードオフに基づき、需要の予測に応じた動的インスタンス化とレプリケーションを実装する。
  • ATLAS や CMS で既に実証済みのプロバンスおよびワークフロー・システムを活用し、仮想データのサポートに必要なきめ細やかなデータルートを記録する。
  • xrootd および ROOT ベースの永続化機能を、効率的なデータアクセスと転送を実現するスケーラブルな分散ストレージシステムと統合する。
  • アクセスパターンに応じて、低コストで高遅延のテープ、バランスの取れた回転ディスク、低遅延で高コストのソリッドステートストレージを組み合わせたストレージティアリングを最適化する。
  • 特にディスク容量の増加が鈍化する傾向やSSDコストの低下に伴うハードウェアトレンドの変化をモニタリングし、コスト効率を維持するための適応を図る。

実験結果

リサーチクエスチョン

  • RQ1HEP実験は、データの可用性や物理解析能力を損なわせることなく、分散型データ管理の運用コストをどのように削減できるか?
  • RQ2必要なときにのみインスタンス化される仮想データモデル—つまり、データが必要なまでに恒久的ストレージに保持されない仕組み—は、生成済みおよびシミュレート済みデータの恒久的ストレージをどの程度代替できるか?
  • RQ3共通化された、分野を越えたインfraストラクチャは、HEPおよびそれ以上の分野における長期的データ保存とオープンサイエンスを実現するために果たす役割は何か?
  • RQ4HEPは、ROOT や xrootd といった既存のソフトウェア、およびプロバンスシステムをどのように活用することで、スケーラブルかつ迅速なデータアクセスと仮想データの実装を可能にできるか?
  • RQ5ディスク容量/コストの改善が鈍化する傾向が今後のHEPコンピューティングおよびストレージアーキテクチャに与える影響は何か?

主な発見

  • LHC実験の運用コストの大部分を占めるのはデータの保管および分析コストであり、ATLAS と CMS は単独で分散型データ管理の運用保守(M&O)に年間約450万ドルを費やしている。
  • LHC実験では現在、すべての恒久的データを同等に扱っているが、大部分のデータをテープ専用に分類することで、コストを顕著に削減できる可能性がある。
  • 回転ディスクの容量/コスト改善は著しく鈍化すると予想され、現在のHEPコンピューティングモデルに混乱をもたらす可能性がある。
  • ソリッドステートストレージは相対的に約3倍安くなり、ランダムアクセスやスパースアクセスに適したものになると予想されるが、効果的であるためにはアプリケーションに適応したキャッシュ戦略が必要となる。
  • データが必要なまでにレシピとしてのみ存在する仮想データの概念—つまり、必要なときにのみ生成されるデータ—により、ストレージとCPUコストの比率の変化に動的に適応できる。
  • LHC実験で既に整備済みのプロバンス記録およびワークフロー・システムには、仮想データと長期的データ保存を支援するためのインfraの多くがすでに備わっている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。