Skip to main content
QUICK REVIEW

[論文レビュー] Astro-WISE: Chaining to the Universe

E. A. Valentijn, John Mc Farland|arXiv (Cornell University)|Feb 7, 2007
Scientific Computing and Data Management参考文献 1被引用数 18
ひとこと要約

Astro-WISE は、永続的なメタデータと実行可能なワークフローを用いて、すべての科学的データ項目を生観測にさかのぼってつなぐスケーラブルでエンドツーエンドのデータ履歴管理システムを導入する。フェデレーテッドでウェブベースのデータベースシステムを通じて、完全な前向きおよび後向きのチェインを強制することで、生データを動的で相互作用的な分析と再現可能でスケーラブルな科学に変換する、分散型の天文学的アーカイブを越えた知識システムへと進化させる。

ABSTRACT

The recent explosion of recorded digital data and its processed derivatives threatens to overwhelm researchers when analysing their experimental data or when looking up data items in archives and file systems. While current hardware developments allow to acquire, process and store 100s of terabytes of data at the cost of a modern sports car, the software systems to handle these data are lagging behind. This general problem is recognized and addressed by various scientific communities, e.g., DATAGRID/EGEE federates compute and storage power over the high-energy physical community, while the astronomical community is building an Internet geared Virtual Observatory, connecting archival data. These large projects either focus on a specific distribution aspect or aim to connect many sub-communities and have a relatively long trajectory for setting standards and a common layer. Here, we report "first light" of a very different solution to the problem initiated by a smaller astronomical IT community. It provides the abstract "scientific information layer" which integrates distributed scientific analysis with distributed processing and federated archiving and publishing. By designing new abstractions and mixing in old ones, a Science Information System with fully scalable cornerstones has been achieved, transforming data systems into knowledge systems. This break-through is facilitated by the full end-to-end linking of all dependent data items, which allows full backward chaining from the observer/researcher to the experiment. Key is the notion that information is intrinsic in nature and thus is the data acquired by a scientific experiment. The new abstraction is that software systems guide the user to that intrinsic information by forcing full backward and forward chaining in the data modelling.

研究の動機と目的

  • 現代の広視野イメージング調査から生じる巨大でマルチテラバイト級の天文学的データストリームを処理する上でのスケーラビリティの危機に対処すること。
  • 新しい手法や校正に伴って完全に再処理が必要となる、従来の「フィードフォワード」型データ処理パイプラインの限界を克服すること。
  • 研究者がすべての派生結果をその生データおよび処理ステップにまでさかのぼれるようにし、再現可能性と透明性を確保すること。
  • 異種のデータソースにわたる分散処理、アーカイブ、出版を統合する、統一的で拡張可能な科学的情報レイヤーを構築すること。
  • ユーザーがカスタム手法で結果を再計算し、その知見をシステムにフィードバックできるようにすることで、インサイト駆動型のインタラクティブ分析を可能にすること。

提案手法

  • システムは、生画像から最終的な科学的パrameterに至るまで、すべてのデータ項目をリレーショナルデータベーススキーマを通じて永続的にリンクすることで、完全な前向きおよび後向きのチェインを強制する。
  • ウェブベースのGUIとPythonの「ピクル」(シリアル化されたオブジェクト)を用いて、ユーザーが変更した分析スクリプトを、Linuxファームのフェデレーションに分散処理ノードへ送信する。
  • オブジェクトの依存関係は、オブジェクト指向の継承、データベースのジョイン、参照、Pythonネームスペースの処理を組み合わせることで、ポインタ機構を統一する。
  • OracleデータベースのパーティショニングとHTM(階層的三角メッシュ)インデックスを活用することで、最大100TBのデータボリュームに対する高速でスケーラブルな照会が可能になる。
  • スタンドアロンのワークフロー管理システムを必要としない動的ワークフロー・エンジンを用いて、オンデマンド処理をサポートする。
  • データ製品にフラグを設定することで、ヨーロッパバーチャルオブザーバトリ(Euro-VO)への公開が可能になり、静的および動的結果の両方が共有可能になる。

実験結果

リサーチクエスチョン

  • RQ1どのように科学的データシステムを再設計すれば、巨大で分散型のデータストリーム全体にわたって完全な再現可能性と履歴追跡を実現できるか?
  • RQ2生データの完全な再処理が不要な状況でも、スケーラブルでインタラクティブな分析を可能にするアーキテクチャパターンは何か?
  • RQ3データ処理、アーカイブ、出版を統合しながら完全なデータラインレージャンスを保持する、統一された情報レイヤーを構築できるか?
  • RQ4研究者がペタバイトスケールのデータセットにおいて、まれなまたは微弱な天体的対象(例:超新星、準定常天体)を効率的に探索するにはどうすればよいか?
  • RQ5エンドツーエンドのデータリンクによって、大規模な観測天文学におけるデータ管理の負担をどの程度軽減し、科学的インサイトをどのように向上できるか?

主な発見

  • システムは、KIDs 1500–5000度調査においてほぼ1テラバイトのデータを効果的に管理・リンクし、大規模なボリュームへのスケーラビリティを実証した。
  • 完全な後向きチェインが達成され、ユーザーが最終結果に寄与したすべてのデータ項目、校正、処理ステップを取得できるようになった。
  • ユーザーが変更したPythonスクリプトを用いたオンデマンドの再処理が可能で、動的でインタラクティブな分析が実現した。
  • 永続的なPython「ピクル」の使用により、カスタム分析ロジックを分散処理ノードへ安全かつ効率的に転送できるようになった。
  • OracleパーティショニングとHTMインデックスの統合により、大規模データセット全体にわたる天体源の多数対多数の関連付けが高速に実現された。
  • 分散された知識とフィードバックループを活用することで、グローバルなアストロメトリックおよびフォトメトリック解が、より高い精度で得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。