Skip to main content
QUICK REVIEW

[論文レビュー] The Earth System Grid: Supporting the Next Generation of Climate Modeling Research

David E. Bernholdt, S. Bharathi|ArXiv.org|Dec 13, 2007
Distributed and Parallel Computing Systems参考文献 9被引用数 6
ひとこと要約

Earth System Grid (ESG) は、Globus Toolkit を基盤とするスケーラブルで分散型のサイバインfra構造を提案し、異種で地理的に分散した複数のサイトにまたがるペタスケールの気候モデルデータの管理・発見・分析を可能にする。認証、高性能データ転送、意味的カタログ化、Webポータルを統合することで、ESG は気候データに対する効率的で安全かつ相互運用可能なアクセスを実現し、次世代の気候研究を大規模に支援する。

ABSTRACT

Understanding the earth's climate system and how it might be changing is a preeminent scientific challenge. Global climate models are used to simulate past, present, and future climates, and experiments are executed continuously on an array of distributed supercomputers. The resulting data archive, spread over several sites, currently contains upwards of 100 TB of simulation data and is growing rapidly. Looking toward mid-decade and beyond, we must anticipate and prepare for distributed climate research data holdings of many petabytes. The Earth System Grid (ESG) is a collaborative interdisciplinary project aimed at addressing the challenge of enabling management, discovery, access, and analysis of these critically important datasets in a distributed and heterogeneous computational environment. The problem is fundamentally a Grid problem. Building upon the Globus toolkit and a variety of other technologies, ESG is developing an environment that addresses authentication, authorization for data access, large-scale data transport and management, services and abstractions for high-performance remote data access, mechanisms for scalable data replication, cataloging with rich semantic and syntactic information, data discovery, distributed monitoring, and Web-based portals for using the system.

研究の動機と目的

  • 複数の機関やストレージシステムにまたがる、巨大で分散型の気候モデルデータセットを管理・アクセスするという増大する課題に対処すること。
  • 気候科学者が異種の計算環境において、シームレスにデータ発見・アクセス・分析が行えるようにすること。
  • 今世紀半ばまでに予想されるペタバイト規模のデータ保有へと進化する気候モデル研究を支援すること。
  • 認証、データレプリケーション、監視、意味的メタデータを統合した、堅牢で拡張可能なインfraストラクチャを構築すること。
  • ユーザーフレンドリーな Web ポータルおよびサービスを提供し、気候シミュレーションデータのリモートでの高性能分析を容易にすること。

提案手法

  • 分散コンピューティングの基盤として、Globus Toolkit を活用し、セキュリティ、データ移動、リソース管理を含む。
  • 複数のサイトにまたがるデータレプリケーションを実装することで、データ可用性の向上とネットワーク遅延の低減を図る分散アーキテクチャを採用する。
  • 意味的メタデータと文法的アノテーションを統合した中央カタログを構築し、豊富で検索可能なデータ発見を可能にする。
  • 大規模な科学的データセット向けに最適化された I/O およびデータ転送プロトコルを用いて、高性能なリモートデータアクセスサービスを開発する。
  • Web ベースのポータルを活用し、ユーザーが低レベルのシステム操作を必要とせずに、データ検索・アクセス・分析が行える直感的なインターフェースを提供する。
  • グリッド全体にまたがるシステムの信頼性とパフォーマンス追跡を確保するため、分散型の監視およびログ記録を統合する。

実験結果

リサーチクエスチョン

  • RQ1分散型で異種のサイトにまたがる環境において、ペタスケールの気候モデルデータを管理・配信するスケーラブルで安全かつ相互運用可能なインfra構造を構築するにはどうすればよいか。
  • RQ2グリッド環境において大規模な科学的データセットへの高性能でリモートアクセスを実現するには、どのようなアーキテクチャ的・技術的要素が必要か。
  • RQ3豊富な意味的および文法的メタデータを効果的に活用することで、効率的なデータ発見およびプロバンセンス追跡を実現するにはどうすればよいか。
  • RQ4複数の機関やシステムにまたがる環境で、データアクセスのための安全な認証および承認を保証するメカニズムは何か。
  • RQ5グローバルな気候データグリッドにおいて、パフォーマンス、可用性、ストレージ効率のバランスをとるデータレプリケーション戦略を設計するにはどうすればよいか。

主な発見

  • Earth System Grid は、複数の分散サイトにまたがる 100 TB を超える気候シミュレーションデータの管理とアクセスを成功裏に実現し、大規模な科学的データに対してスケーラビリティを実証した。
  • Globus ベースのサービス統合により、安全で高性能なデータ転送とリモートアクセスが可能となり、研究者によるデータへのアクセス性が顕著に向上した。
  • 豊富なメタデータを用いた意味的カタログ化により、異種のデータ形式やデータソース間でも、正確で効率的なデータ発見が可能になった。
  • スケーラブルなデータレプリケーションが実装されており、グローバルユーザーに対するデータ可用性の向上と遅延低減が実現された。
  • Web ベースのポータルにより、ユーザーが低レベルのシステム知識を必要とせずに、データ発見・アクセス・分析が行えるユーザーフレンドリーなインターフェースが提供された。
  • アーキテクチャは拡張可能であり、今世紀の前半に予想されるペタスケールのデータ保有に対応するよう設計されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。