Skip to main content
QUICK REVIEW

[論文レビュー] A monitoring tool for a GRID operation center

Sergio Andreozzi, S. Fantinel|ArXiv.org|Jun 3, 2003
Distributed and Parallel Computing Systems被引用数 4
ひとこと要約

本論文では、世界規模のGridテストベッドWorldGRID向けに開発されたNagiosベースの監視ツールEDT-Monitorを提示する。地理的動的マップを用いた仮想組織(VO)中心の監視を可能とし、リアルタイムでリソースブローカーの不具合、誤設定されたサイト、ジョブディスpatch失敗などの問題を検出することで、大規模なHEPワークロードにおけるシステムの信頼性と運用への対応速度を向上させる。

ABSTRACT

WorldGRID is an intercontinental testbed spanning Europe and the US integrating architecturally different Grid implementations based on the Globus toolkit. The WorldGRID testbed has been successfully demonstrated during the WorldGRID demos at SuperComputing 2002 (Baltimore) and IST2002 (Copenhagen) where real HEP application jobs were transparently submitted from US and Europe using "native" mechanisms and run where resources were available, independently of their location. To monitor the behavior and performance of such testbed and spot problems as soon as they arise, DataTAG has developed the EDT-Monitor tool based on the Nagios package that allows for Virtual Organization centric views of the Grid through dynamic geographical maps. The tool has been used to spot several problems during the WorldGRID operations, such as malfunctioning Resource Brokers or Information Servers, sites not correctly configured, job dispatching problems, etc. In this paper we give an overview of the package, its features and scalability solutions and we report on the experience acquired and the benefit that a GRID operation center would gain from such a tool.

研究の動機と目的

  • 複雑で地理的に分散した、多様なコンponentsを有するGridインfra構造の監視の課題に対処すること。
  • 複数の大陸にまたがるGridリソースの健全性とパフォーマンスに対するリアルタイムの可視性を提供すること。
  • 大規模なGrid展開における運用監視の簡素化を実現する仮想組織(VO)中心の監視を支援すること。
  • 運用中の生産環境において、障害したブローカーや誤設定されたサイトなどのインfra構造上の問題を、事前に検出し報告すること。
  • 自動化され、中央集権的な監視によって、Grid運用センターのスケーラビリティと保守性を向上させること。

提案手法

  • EDT-Monitorツールは、サービスおよびホスト監視の分野で実績のあるNagiosオープンソース監視フレームワークを基盤として構築されている。
  • リソースブローカーや情報サーバーを含むGlobus ToolkitベースのGridコンponentsと統合し、リアルタイムのステータスデータ収集を実現している。
  • ヨーロッパと米国をカバーする地理的動的マップを生成し、Gridサイトの運用状態を可視化することで、障害の空間的相関を把握可能としている。
  • 仮想組織(VO)中心のビューをサポートし、管理者がVOメンバーシップやジョブ提出パターンに基づいてリソースを監視できるようにしている。
  • イベント駆動型のアラートとステータス集約を用いることで、数100の分散Gridサイトおよびサービスにスケーリング可能である。
  • ジョブ実行行動(ジョブディスpatch遅延やリソースの利用不可など)と監視データを照合可能としている。

実験結果

リサーチクエスチョン

  • RQ1地理的に分散し、多様なコンponentsを有するインfra構造において、リアルタイムで大規模なGrid運用を効果的に支援できる監視システムとは何か?
  • RQ2マルチドメインのGrid環境において、仮想組織(VO)中心の監視を実現するメカニズムは何か?
  • RQ3動的地理的可視化は、Grid運用センターにおける障害検出および運用対応をどのように改善できるか?
  • RQ4生産用Gridテストベッドにおける監視ツールに求められるスケーラビリティおよび信頼性の特徴は何か?
  • RQ5監視ツールは、ジョブ実行に影響を与える前に、障害したブローカーや誤設定されたサイトなどのインfra構造上の問題をどのように検出し報告できるか?

主な発見

  • EDT-MonitorはWorldGRIDのデモ中に、故障したリソースブローカーや誤設定されたサイトを含む複数の運用上の問題を正常に検出し報告した。
  • 本ツールにより、ジョブディスpatchの問題がリアルタイムで特定可能となり、Gridインfra構造の障害検出までの平均時間(MTTD)が短縮された。
  • 地理的動的マップにより、直感的で空間的認識を持つGrid状態の可視化が可能となり、運用センターのスタッフの状況認識能力が向上した。
  • Nagiosとの統合により、最小限のパフォーマンスオーバーヘッドで、数100のGridコンponentsに対する堅牢でスケーラブルな監視が実現された。
  • VO中心の監視モデルにより、管理者が組織的境界に基づいて問題を特定・トラブルシューティング可能となり、運用効率が向上した。
  • 本ツールはSuperComputing 2002やIST2002といった主要イベントにおいて実用的であることが実証され、実世界のGrid運用における有効性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。