Skip to main content
QUICK REVIEW

[論文レビュー] The Need for a Versioned Data Analysis Software Environment

Jakob Blomer, D. Berzano|arXiv (Cornell University)|Jul 11, 2014
Distributed and Parallel Computing Systems参考文献 8被引用数 3
ひとこと要約

この論文では、科学的ソフトウェアバイナリの配布を最適化したバージョン管理可能でコンテンツアドレスブルのファイルシステム、CernVM-FSを提案する。これにより、複雑で再現可能なデータ解析環境のスナップショット作成とデプロイが効率的に行える。ソフトウェアを中央サーバーに一度だけ保存し、HTTPを介してキャッシュを備えたプロキシ経由で配布することで、デプロイ時間を数日から1時間未塔に短縮し、履歴のある解析環境をバージョン管理されたスナップショットとして保持できる。

ABSTRACT

Scientific results in high-energy physics and in many other fields often rely on complex software stacks. In order to support reproducibility and scrutiny of the results, it is good practice to use open source software and to cite software packages and versions. With ever-growing complexity of scientific software on one side and with IT life-cycles of only a few years on the other side, however, it turns out that despite source code availability the setup and the validation of a minimal usable analysis environment can easily become prohibitively expensive. We argue that there is a substantial gap between merely having access to versioned source code and the ability to create a data analysis runtime environment. In order to preserve all the different variants of the data analysis runtime environment, we developed a snapshotting file system optimized for software distribution. We report on our experience in preserving the analysis environment for high-energy physics such as the software landscape used to discover the Higgs boson at the Large Hadron Collider.

研究の動機と目的

  • 高エネルギー物理学における、複雑で急速に進化するソフトウェアスタックの科学的データ解析環境を再現する課題に対処すること。
  • 古くさたり、バージョン管理されていない依存関係による、レガシーデータ解析環境の長時間でエラーを起こしやすいセットアップ時間の問題を解決すること。
  • コンpiler、ライブラリ、システムツールを含む、完全で利用可能なデータ解析環境の長期的保存を可能にすること。
  • 大型実験(例:LHC)を含む、グローバルなコンピューティングインfraストラクチャにおける科学的ソフトウェアのデプロイオーバーヘッドを低減すること。
  • ソースコードだけでなくバイナリソフトウェアのバージョン管理と配布を効率的に行うメカニズムを提供し、再現性を支援すること。

提案手法

  • ソフトウェア配布とバージョン管理に最適化された分散型でコンテンツアドレスブルのファイルシステム、CernVM-FSの設計および導入。
  • ソフトウェアバイナリ、コンパイラ、ツール、OSコンponentを中央サーバーに保存し、グローバルキャッシュプロキシを介したHTTP経由でクライアントに配信。
  • ハッシュツリーとコンテンツアドレスブルストレージを用いて、データの重複削減、効率的なキャッシュ、およびファイルシステムスナップショットのネイティブサポートを実現。
  • クライアントマシン上で、ファイルシステムの任意の履歴スナップショットをマウント可能にし、過去の完全な解析環境へのアクセスを可能に。
  • CernVM-FSを仮想マシンイメージに統合し、OSの完全再構築の必要を減らすために、VMにカーネルとクライントソフトウェアのみを保存。
  • 既存のインfraストラクチャとプロトコルを活用し、既存のワークフローへの変更を最小限に抑えつつ、バージョン管理可能で再現可能な環境を実現。

実験結果

リサーチクエスチョン

  • RQ1システムレベルのソフトウェア、コンパイラ、ライブラリを含む完全でバージョン管理されたデータ解析環境を、どのように効率的に保存・再現できるか。
  • RQ2グローバルなコンピューティングインfraストラクチャに、歴史的に正確な解析環境をデプロイする際の時間的・複雑さを軽減するメカニズムは何か。
  • RQ3独立したリリースサイクルを持つ数多くの科学的ソフトウェアコンポonent間の依存関係をどのように管理できるか。
  • RQ4バージョン管理可能で分散型のファイルシステムが、高エネルギー物理学における科学的結果の長期的再現性をどのように支援できるか。
  • RQ5現在のソフトウェアバージョン管理システムがバイナリソフトウェア配布に適用された際の限界は何か。それらの限界をどのように是正できるか。

主な発見

  • CernVM-FSは、LHC実験において、新しいソフトウェアリリースの構築からグローバルな展開までの時間を、数日から1時間未塔に短縮した。
  • このシステムにより、データ解析環境の任意の履歴スナップショットへの透明なアクセスが可能になり、ソフトウェア環境の「タイムマシン」を実現した。
  • コンテンツアドレスブルストレージとグローバルキャッシュを活用することで、CernVM-FSは地理的に分散したクライアント間で高いデータ重複削減と効率的な配布を達成した。
  • VMにカーネルとクライントソフトウェアのみを保存することで、仮想マシンイメージの再構築の必要性が顕著に減少した。
  • このアプローチにより、ヒッグスボソン発見に使用されたような、複雑で多層的なソフトウェアスタックを、特定のコンパイラおよびライブラリバージョンレベルまで保存可能となった。
  • スナップショットの作成やデプロイにおいて成功を収めたが、現在のところ、2つのスナップショット間で何が変更されたかをネイティブに追跡する機能が欠如しており、環境差のトレーサビリティが制限されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。