[論文レビュー] GridMonitor: Integration of Large Scale Facility Fabric Monitoring with Meta Data Service in Grid Environment
GridMonitorは、大規模な施設監視とGridメタデータサービス(MDS)を統合したスケーラブルな4段階アーキテクチャを提案し、地理的に分散した施設における異種の計算、ストレージ、ネットワークリソースのリアルタイムで適応可能な監視を可能にする。NWS、SNMP、GMAといった既存のツールを活用し、MDSを用いて標準化され動的に行われるリソース状態の発見および公開を実現し、ブルークン国立研究所の10クラスタ施設で1,000台以上のノードに展開された。
Grid computing consists of the coordinated use of large sets of diverse, geographically distributed resources for high performance computation. Effective monitoring of these computing resources is extremely important to allow efficient use on the Grid. The large number of heterogeneous computing entities available in Grids makes the task challenging. In this work, we describe a Grid monitoring system, called GridMonitor, that captures and makes available the most important information from a large computing facility. The Grid monitoring system consists of four tiers: local monitoring, archiving, publishing and harnessing. This architecture was applied on a large scale linux farm and network infrastructure. It can be used by many higher-level Grid services including scheduling services and resource brokering.
研究の動機と目的
- Grid環境における大規模で異種的かつ動的に変化するコンピューティング施設の監視課題に対処すること。
- 数千台の地理的に分散したノードの監視において、システムのオーバーヘッドを低減しスケーラビリティを向上させること。
- 低レベルの施設監視とジョブスケジューラーやリソースブローカーなどの高レベルのGridサービスとのシームレスな統合を可能にすること。
- 動的なリソース参加および退出に対応するため、適応的かつ拡張可能な監視インfraを提供すること。
- MDSおよびGMAを通じて標準化されアクセス可能な監視データを活用し、障害検出、パフォーマンスチューニング、リソーススケジューリングを向上させること。
提案手法
- 本システムは、モジュラーでスケーラブルなデータ収集および配信を可能にする4段階アーキテクチャ(ローカル監視、アーカイブ、公開、ハーネス)を採用している。
- ローカル監視エージェントがノードからCPU、ディスク、ネットワークなどのリアルタイムメトリクスを収集し、テレメトリデータベースを介して中央集約データストアに転送する。
- ネットワークウェザーサービス(NWS)を統合し、CPU利用可能時間、遅延、帯域幅の短期的性能予測を、アクティブプローブと履歴データを用いて提供する。
- SNMPベースのセンサーを用いて、軽量で拡張性のあるネットワークおよびデバイス監視を実現し、広範なハードウェア互換性を確保する。
- 監視データは、LDAPベースの階層的ストレージを用いた監視および発見サービス(MDS)を通じて公開され、リソースの動的登録および発見が可能になる。
- グリッド監視アーキテクチャ(GMA)を用いてストリーミング型の公開/購読通信をサポートし、スケジューラーや障害検出システムなどのコンシューマーにリアルタイムのイベント配信を可能にする。
実験結果
リサーチクエスチョン
- RQ1大規模なコンピューティング施設における10台以上のクラスタにまたがる1,000台を超える異種ノードを効率的に監視するには、どのような方法があるか?
- RQ2低レベルの施設監視とMDSのような高レベルのGridメタデータサービスとの間で、どのようにシームレスな統合を実現できるか?
- RQ3ノードがプールに参加・退出する動的なGridリソースの性質に対応するには、監視システムはどのように設計すべきか?
- RQ4NWS、SNMP、GMAといった既存ツールが、堅牢で拡張可能かつ低オーバーヘッドな監視インfraを構築するために果たす役割は何か?
- RQ5標準化され、公開/購読型の監視が、分散Grid環境におけるリソース発見、スケジューリング、障害検出にどの程度向上効果をもたらすか?
主な発見
- GridMonitorは、ブルークン国立研究所の10クラスタ施設で1,000台以上のノードを効果的に監視し、大規模なLinuxファームおよびネットワークインfraにおけるスケーラビリティを実証した。
- NWSの統合により、アクティブプローブと履歴データを用いて、エンドツーエンドの遅延および帯域幅の正確な短期的性能予測が可能になった。
- SNMPベースのセンサーは、最小限のシステムオーバーヘッドでネットワークおよびデバイスの状態監視に効果的に使用され、広範なハードウェア互換性が確保された。
- MDSの使用により、リソースの動的登録および発見が可能になり、新しいノードやサービスがグリッド情報システム内で自動的に検出され、公開されるようになった。
- GMAベースのストリーミングモデルにより、ポーリングベースのモデルと比較して、スケジューリングおよび障害検出の応答性が向上した。
- 4段階アーキテクチャにより、施設監視とGridレベルの運用が明確に分離され、監視ツールとGridサービスの独立した進化が可能になった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。