Skip to main content
QUICK REVIEW

[論文レビュー] Monitoring, Analyzing, and Controlling Internet-scale Systems with ACME

David Oppenheimer, Vitaliy Vatkovskiy|ArXiv.org|Aug 14, 2004
Peer-to-Peer Network Technologies参考文献 31被引用数 9
ひとこと要約

ACMEは、インターネット規模のシステムの監視、分析、制御を可能にするスケーラブルなインfra構造であり、ネットワーク内でのセンサデータ集約を実現するISINGと、イベント駆動型のアクチュエーションを実現するENTRIEから構成される。ネットワーク内集約によりエンドツーエンドのクエリ遅延を50%以上削減し、4秒未満でアクチュエーターを起動することで、ベンチマーキングおよび異常検出のシナリオにおいて有効性を示している。

ABSTRACT

Analyzing and controlling large distributed services under a wide range of conditions is difficult. Yet these capabilities are essential to a number of important development and operational tasks such as benchmarking, testing, and system management. To facilitate these tasks, we have built the Application Control and Monitoring Environment (ACME), a scalable, flexible infrastructure for monitoring, analyzing, and controlling Internet-scale systems. ACME consists of two parts. ISING, the Internet Sensor In-Network agGregator, queries sensors and aggregates the results as they are routed through an overlay network. ENTRIE, the ENgine for TRiggering Internet Events, uses the data streams supplied by ISING, in combination with a user's XML configuration file, to trigger actuators such as killing processes during a robustness benchmark or paging a system administrator when predefined anomalous conditions are observed. In this paper we describe the design, implementation, and evaluation of ACME and its constituent parts. We find that for a 512-node system running atop an emulated Internet topology, ISING's use of in-network aggregation can reduce end-to-end query-response latency by more than 50% compared to using either direct network connections or the same overlay network without aggregation. We also find that an untuned implementation of ACME can invoke an actuator on one or all nodes in response to a discrete or aggregate event in less than four seconds, and we illustrate ACME's applicability to concrete benchmarking and monitoring scenarios.

研究の動機と目的

  • 多様な運用条件下における大規模分散システムの監視および制御の難しさに対処すること。
  • インターネット規模の環境における柔軟なベンチマーキング、テスト、およびシステム管理を支援するシステムの設計。
  • センサデータ収集のための分散クエリ処理におけるエンドツーエンド遅延の低減。
  • 自動化されたアクチュエーター機構を通じて、システムイベントに対してリアルタイムで応答すること。
  • エミュレーテッド大規模トポロジーにおける提案アーキテクチャのスケーラビリティおよびパフォーマンスの評価。

提案手法

  • ISINGはオーバーレイネットワークを用いてセンサクエリをルーティングし、ネットワーク内での集約を実行することで、データ送信量と遅延を最小限に抑える。
  • センサデータはオーバーレイを通過する間に収集・集約され、重複するデータ転送が削減される。
  • ENTRIEはISINGからのデータストリームを受信し、ユーザー定義のXML設定ファイルを解釈して条件を検出、対応するアクションをトリガーする。
  • プロセスの終了や管理者へのアラート送信などのアクチュエーターは、事前に定義されたイベントトリガーに基づいて起動される。
  • ノード単位およびグローバルなイベント検出をサポートしており、細かめの制御から広範囲の制御まで可能である。
  • 遅延および応答時間の測定を目的として、512ノードのエミュレーテッドインターネットトポロジーを用いてアーキテクチャを評価している。

実験結果

リサーチクエスチョン

  • RQ1ネットワーク内集約は、大規模分散監視システムにおけるエンドツーエンド遅延をどのように低減できるか?
  • RQ2エミュレーテッドインターネット規模環境にスケーラブルな監視および制御インfraを展開する際のパフォーマンスオーバーヘッドはどの程度か?
  • RQ3システムイベントに対して、実用的な時間窓内でアクチュエーターを起動できるか?
  • RQ4このシステムは、ベンチマーキングおよび異常検出ワークロードのサポートにおいてどの程度有効か?
  • RQ5ACMEアーキテクチャは、異なるシステム負荷およびトポロジー下でどの程度スケーラブルか?

主な発見

  • 512ノードのシステムにおいて、直接ネットワーク接続または非集約型オーバーレイネットワークと比較して、ISINGはエンドツーエンドのクエリ応答遅延を50%以上削減した。
  • チューニングを行わないACMEの実装でも、離散的または集約的なイベント発生時に、1ノードまたは全ノードのアクチュエーターを4秒未満で起動できる。
  • しきい値を超えた場合に自動プロセス終了を可能にするため、システムの耐障害性ベンチマーキングを効果的にサポートした。
  • ネットワーク内集約の活用により、大規模展開におけるネットワーク帯域幅の使用量が顕著に削減され、スケーラビリティが向上した。
  • ACMEは、システムの異常検出や自動応答を含む、実世界の監視および制御シナリオにおいて実用的応用が可能であることを示した。
  • エミュレーテッドインターネットトポロジーにおいても、ACMEアーキテクチャは効果的にスケーリングでき、複雑な監視および制御ワークロードをサポートした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。