Skip to main content
QUICK REVIEW

[論文レビュー] Monitoring Large-Scale Cloud Systems with Layered Gossip Protocols

Jonathan S. Ward, Adam Barker|arXiv (Cornell University)|May 31, 2013
Peer-to-Peer Network Technologies参考文献 2被引用数 4
ひとこと要約

本稿では、大規模なクラウドシステムにおけるスケーラブルな監視を実現する分散型で階層的なガスピングプロトコルを提案する。中央集権的な監視インfra構造の必要性を排除する。ワークロードの類似性に基づいて仮想マシンを階層的なグループに整理し、効率的で局所的なガスピングを実装することで、低遅延かつフェイルセーフな監視を実現。中央集権的システムと比較して最大74%多いメッセージ送信量にとどまるが、高帯域幅のクラウド環境では実用的である。

ABSTRACT

Monitoring is an essential aspect of maintaining and developing computer systems that increases in difficulty proportional to the size of the system. The need for robust monitoring tools has become more evident with the advent of cloud computing. Infrastructure as a Service (IaaS) clouds allow end users to deploy vast numbers of virtual machines as part of dynamic and transient architectures. Current monitoring solutions, including many of those in the open-source domain rely on outdated concepts including manual deployment and configuration, centralised data collection and adapt poorly to membership churn. In this paper we propose the development of a cloud monitoring suite to provide scalable and robust lookup, data collection and analysis services for large-scale cloud systems. In lieu of centrally managed monitoring we propose a multi-tier architecture using a layered gossip protocol to aggregate monitoring information and facilitate lookup, information collection and the identification of redundant capacity. This allows for a resource aware data collection and storage architecture that operates over the system being monitored. This in turn enables monitoring to be done in-situ without the need for significant additional infrastructure to facilitate monitoring services. We evaluate this approach against alternative monitoring paradigms and demonstrate how our solution is well adapted to usage in a cloud-computing context.

研究の動機と目的

  • 大規模かつエラスティックなクラウド環境における従来の中央集権的監視のスケーラビリティとフェイルセーフ性の課題に対処する。
  • クラウドシステムが拡大するにつれて高コストかつ遅延が生じる中央集権的データ収集の限界を克服する。
  • 専用監視インfraを設ける必要をなくし、分散型ガスピングベースのアーキテクチャにより自己監視を可能にする。
  • VMの動的プロビジョニングやリソース解放に伴う再設定や追加のデプロイコストが不要な、イン・サイド監視を可能にする。
  • グループやクラウドリージョンを越えた監視データの階層的集約を通じて、全体的なリソース使用状況の可視化を実現する。

提案手法

  • クラウドのトポロジーを反映する3層アーキテクチャを設計:VM(リーフノード)、グループ(類似したVMの論理的クラスタ)、クラウド(地理的リージョン)。
  • ソフトウェアワークロード(例:ウェブサーバ、Hadoopノード)に基づいてVMをグループ化するための特徴ベクトルを用い、効率的なデータ配布のための意味的近接性を実現する。
  • グループ内での定期的かつ割合に応じたガスピングを実装:各VMは低遅延UDPを用いて、ピアの一部にリソース使用状況(CPU、メモリ、ディスク、ネットワーク)をガスピングする。
  • グループレベルのリソース使用状況を集約し、より低いレートで他のグループに伝搬することで、グループ間通信のオーバーヘッドを削減する。
  • より高い遅延と帯域幅コストを考慮し、信頼性の高いプロトコルを用いてリージョンレベルの集約データを複数のクラウド間で伝搬する。
  • 実行時において自己組織的でオーバレイガスピングネットワークを構築し、追加のインfraや事前デプロイ済みの監視サーバが不要な監視を実現する。

実験結果

リサーチクエスチョン

  • RQ1大規模かつエラスティックなクラウド環境において、分散型ガスピングプロトコルは中央集権的監視を効果的に代替可能か?
  • RQ2フラットガスピングや中央集権的モデルと比較して、階層的ガスピングアーキテクチャは通信オーバーヘッドをどの程度低減できるか?
  • RQ3IaaSクラウドにおいて、専用監視インfraがなくても、イン・サイド監視がどの程度可能か?
  • RQ4ワークロードの類似性に基づいてVMをグループ化することで、監視の効率性とスケーラビリティはどの程度向上するか?
  • RQ5大規模クラウド監視において、メッセージ量と分散化のトレードオフはどのようなものか?

主な発見

  • 階層的ガスピングプロトコルにより、フラットガスピングと比較してメッセージレートが顕著に低減され、よりスケーラブルで効率的なデータ集約パターンが実現された。
  • 中央集権的システムと比較して最大74%多いメッセージ送信量であっても、高帯域幅・低遅延のクラウド環境では通信オーバーヘッドが実用的である。
  • 階層的設計により、グループ内での効率的かつ局所的なデータ伝搬が可能であり、グループ間およびクラウド間通信のオーバーヘッドが最小限に抑えられた。
  • 完全な分散化が達成され、単一障害点が排除され、外部監視インfraへの依存が著しく低減された。
  • VMのプロビジョニングや廃棄に伴う再設定が最小限で済むため、自己監視が可能であり、動的でエラスティックなクラウド環境を効果的にサポートした。
  • 集約されたリージョンレベルの要約を通じて、全体的なリソース使用状況の可視化が可能となり、高度な監視および分析の基盤が構築された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。