[論文レビュー] A Monitoring System for the BaBar INFN Computing Cluster
PerfMC は、SNMP を使用して、PC、スイッチ、テープライブラリを含む多様なデバイスからパフォーマンスデータを収集する、軽量で XML ベースの監視システムであり、大規模なコンピューティングクラスタ向けに設計されている。Web サーバーを内蔵し、XSLT を用いて内部の XML ステータスデータを変換することで、リアルタイムのグラフとカスタマイズ可能な HTML/XML ステータスページを生成する。これにより、10 秒程度のポーリング間隔で、最大 200 台のデュアルCPUマシンから成るクラスタにおいて、低オーバーヘッドかつスケーラブルな監視が実現される。
Monitoring large clusters is a challenging problem. It is necessary to observe a large quantity of devices with a reasonably short delay between consecutive observations. The set of monitored devices may include PCs, network switches, tape libraries and other equipments. The monitoring activity should not impact the performances of the system. In this paper we present PerfMC, a monitoring system for large clusters. PerfMC is driven by an XML configuration file, and uses the Simple Network Management Protocol (SNMP) for data collection. SNMP is a standard protocol implemented by many networked equipments, so the tool can be used to monitor a wide range of devices. System administrators can display informations on the status of each device by connecting to a WEB server embedded in PerfMC. The WEB server can produce graphs showing the value of different monitored quantities as a function of time; it can also produce arbitrary XML pages by applying XSL Transformations to an internal XML representation of the cluster's status. XSL Transformations may be used to produce HTML pages which can be displayed by ordinary WEB browsers. PerfMC aims at being relatively easy to configure and operate, and highly efficient. It is currently being used to monitor the Italian Reprocessing farm for the BaBar experiment, which is made of about 200 dual-CPU Linux machines.
研究の動機と目的
- 数百ノードから成る大規模なハイパフォーマンスコンピューティングクラスタを、効率的かつ非侵襲的に監視する課題に対処する。
- しばしば閉鎖型で、設定が難しく、高速LANベースのクラスタに不適切な既存の監視ツールの制限を克服する。
- SNMP などの標準プロトコルを用いて、異種デバイスをサポートする柔軟で拡張可能な監視ソリューションを提供する。
- XSLT 変換された XML 出力に基づくウェブベースの技術を用いて、クラスタステータスのリアルタイム可視化とレポートを実現する。
- クラスタパフォーマンスに影響を与えないように、ネットワークおよびシステムのオーバーヘッドを最小限に抑える。特に中程度のポーリング周波数において重要である。
提案手法
- 監視対象とパrameter を定義する XML 設定ファイルを用いることで、簡単なセットアップとカスタマイズが可能になる。
- SNMPv2 のバッチリクエストを活用し、1回の往復で複数の MIB 変数を効率的に取得することで、ネットワーク負荷を低減する。
- PerfMC 内部に軽量な Web サーバーを統合し、内部の XML ステータスデータを XSLT 変換によって動的に生成された HTML ページを提供する。
- パフォーマンスメトリクスをタイムシリーズ分析およびグラフ生成用に、ラウンドロビンデータベース (RRD) ファイルに格納する。
- Net-SNMP フレームワークを介してカスタム MIB のサポートを可能にすることで、アプリケーションレベルのメトリクスの監視が可能になる。
- 複数の監視モニタを用いた階層的アーキテクチャをサポートすることで、水平スケーラビリティを実現する。各モニタはクラスタのサブセットを管理する。
実験結果
リサーチクエスチョン
- RQ1どのようにすれば、パフォーマンスへの影響を最小限に抑えながら、大規模かつ同種のコンピューティングクラスタに効率的にスケーラブルに監視システムを設計できるか?
- RQ2SNMP や XML、XSLT のような標準的でオープンなプロトコルおよび拡張可能なデータフォーマットを活用することで、どれほど柔軟で保守性の高い監視インfraを構築できるか?
- RQ3高速LAN環境下で、サーバー、スイッチ、テープライブラリなどの多様なデバイスを低オーバーヘッドでリアルタイムに監視するためのアーキテクチャパターンは何か?
- RQ4カスタムクライントソフトウェアを必要とせずに、標準的なウェブ技術を用いて監視データを可視化し公開するにはどうすればよいか?
- RQ5非常に大規模なクラスタにおいて、フェイルセーフと階層的監視をサポートするためのメカニズムは何か?
主な発見
- PerfMC は、約 10 秒のポーリング間隔で監視を行う場合、監視対象デバイスおよびネットワークへの影響が著しく小さく、低オーバーヘッドを達成している。
- SNMPv2 のバッチ操作の使用により、複数の MIB 変数からデータを収集するのに必要なパケット数が顕著に削減され、効率性が向上した。
- XSLT 変換の統合により、カスタムウェブ開発を必要とせず、動的でカスタマイズ可能なウェブベースのステータスレポートおよびダッシュボードの生成が可能になった。
- 現在のプロトタイプでは、パフォーマンスボトルネックが観測されない限り、最大 200 台のデュアルCPUマシンから成るクラスタにおいてもスケーラビリティを示している。
- 著者らは、RRDTool の更新パフォーマンスが将来的なスケーラビリティのボトルネックである可能性を特定し、クラスタを複数の監視モニタに分割することで解決策を提案している。
- しきい値監視と RMON準拠の SNMP エージェントに基づくアラームシステムの開発が計画されており、MIB 変数のしきい値とホストの応答なし状態の両方の検出が可能になる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。