Skip to main content
QUICK REVIEW

[論文レビュー] Challenges for LSST scale data sets

M. J. Way|arXiv (Cornell University)|Aug 25, 2011
Astronomy and Astrophysical Research参考文献 5被引用数 3
ひとこと要約

この論文は、Large Synoptic Survey Telescope (LSST) のデータ洪水に起因する計算課題を検討し、2MASSからSDSSまでのデータアクセスモデルを比較し、将来のワークフローを予測する。著者らは、ストレージコストの低下によりLSSTデータのローカルストレージが技術的に可能であるものの、I/Oボトルネックと高度な解析におけるO(N²)の複雑性が、データベースに近い計算へと移行を余儀なくされると主張する。これにより、LSST規模のデータセットの科学的利用を可能にする、強固で高I/O性能を持つ計算センターの開発が急務であると提言する。

ABSTRACT

The Large Synoptic Survey Telescope (LSST) simulator being built by Andy Connolly and collaborators is an impressive undertaking and should make working with LSST in the beginning stages far more easy than it was initially with the Sloan Digital Sky Survey. However, I would like to focus on an equally important problem that has not yet been discussed here, but in the coming years the community will need to address -- can we deal with the flood of data from LSST and will we need to rethink the way we work?

研究の動機と目的

  • 2MASSおよびSDSSで用いられる伝統的なデータ分析ワークフローが、LSSTのペタバイト規模のデータセットにスケーリング可能かどうかを評価すること。
  • LSSTデータに対するローカルストレージとレガシーツールの使用可能性の妥当性を評価すること。
  • LSST規模のデータを処理するために、特にデータローカル計算を含む新しい計算パラダイムの必要性を調査すること。
  • 高性能計算センターがLSSTデータからの科学的発見を可能にする役割を特定すること。

提案手法

  • 2MASS(ディスクベース、ASCIIカタログ)からSDSS(SQLベース、Webクエリインターフェース)までの歴史的データアクセスモデルを比較し、データインタラクションのベースラインを確立する。
  • LSSTのデータスケールを分析し、10年間で10 PBのクエリデータベースと60 PBの画像データを推定し、計算要件を予測する。
  • Amdahlの法則を応用してシステムのバランスを評価し、CPUおよびメモリの増加に比してI/O制限が顕著である点に注目する。
  • クラスタリングや分類などのO(N²)アルゴリズムをLSST規模のデータで実行可能かどうかを評価し、高いI/O帯域幅がなければO(N)アルゴリズムですら現実的でないことを指摘する。
  • 高I/O性能を持つ計算センター(例:国立スーパーコンピュータセンター)のみが、最もデータ集約的な科学的ワークフローをサポート可能であると提言する。
  • SQLベースのWebインターフェース(例:CASJOBS)の継続的利用を提唱するが、ローカルデータ利用はI/O性能の制限により限界があると警告する。

実験結果

リサーチクエスチョン

  • RQ1I/O制限が存在する中で、研究者はLSST規模のデータセットに対し、2MASS風のローカルデータ分析ツールを引き続き使用可能か?
  • RQ2スケールとI/O要件を鑑みれば、SDSS風のWebベースSQLクエリがLSSTデータに対してどれほど持続可能か?
  • RQ3特にO(N²)アルゴリズムを含む多くのLSST科学的目標を達成するため、根本的なデータローカル計算への移行が不可欠か?
  • RQ4高I/O性能を持つ計算センターは、LSSTデータのスケーラブルな分析を可能にする上で果たす役割は何か?
  • RQ5ストレージ密度およびI/O性能の歴史的トレンドは、LSSTデータのローカルストレージと分析を支えるのに十分か?

主な発見

  • ストレージコストの低下とディスク密度の向上により、LSST全データセットをデスクトップシステムにローカルストレージすることは技術的に可能である。
  • 技術的実現可能性にかかわらず、特に1ディスクあたり100MB/sのシーケンシャルI/Oボトルネックが、LSST規模のデータに対して従来ツールを使用する際のパフォーマンスを著しく制限する。
  • ペタスケールI/Oを処理可能なバランスの取れたシステムを実現するには、1ディスクあたり100MB/sを出力する約100万台のディスクが必要であり、これは顕著なインfraストラクチャ課題を示している。
  • Amdahlの法則に従えば、I/Oの改善がCPUおよびメモリの向上と比例しなければ、多くのレガシーツールはLSST全データ分析に対して実用的でなくなる。
  • クラスタリングや密度推定などのO(N²)演算を含む科学的ワークフローは、高スルーレートI/Oがなければ、ローカルシステムでは実行不能であり、中央集権的なデータセンターでの計算が不可欠となる。
  • PSC、NCSA、NASなどの国立スーパーコンピュータセンターは、LSSTデータをホスティングし、データローカル計算を必要とする専門家ユーザーを支援する最適な位置にある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。