Skip to main content
QUICK REVIEW

[論文レビュー] A note on "The Need for End-to-End Evaluation of Cloud Availability"

Maurizio Naldi|arXiv (Cornell University)|Aug 3, 2014
Cloud Computing and Resource Management参考文献 19被引用数 4
ひとこと要約

このノートは、2014年のPAM研究におけるクラウド可用性の測定手法を批判しており、10〜11分ごとの低頻度のプローブが、一時的な障害を無視するリスクを伴い、障害継続時間の推定が不正確になり、SLA違反の評価が誤りとなる可能性があると指摘している。障害検出の信頼性を高めるため、より高い頻度でのプローブと、改善された統計モデルの導入を提言する。

ABSTRACT

Cloud availability is a major performance parameter for cloud platforms, but there are very few measurements on commercial platforms, and most of them rely on outage reports as appeared on specialized sites, providers' dashboards, or the general press. A paper recently presented at the PAM 2014 conference by Hu et alii reports the results of a measurement campaign. In this note, the results of that paper are summarized, highlighting sources of inaccuracy and some possible improvements. In particular, the use of a low probing frequency could lead to non detection of short outages, as well as to an inaccurate estimation of the outage duration statistics. Overcoming this lack of accuracy is relevant to properly assess SLA violations and establish the basis for insurance claims.

研究の動機と目的

  • ICMPおよびHTTPプローブ手法を用いたエンドツーエンドのクラウド可用性測定の正確性を評価すること。
  • 特に、低頻度のプローブが障害検出に与える影響を含め、Huらの研究における限界を特定すること。
  • 正確なSLA違反検出および補償評価のため、障害継続時間統計の推定を改善すること。
  • 正確な障害継続時間および頻度の測定を可能にすることで、信頼性の高い保険請求評価を支援すること。
  • 第三者的なクラウド可用性ベンチマークにおける手法改善を提言し、堅牢なSLA適合性検証を実現すること。

提案手法

  • ICMPプロトコルはフ론トエンドサーバーの到達可能性をテストし、HTTPプロトコルはアプリケーションレベルのサービス機能をテストする。
  • 23および54のPlanetLabベンチマークポイントを対象に、それぞれ33日および75日間の測定キャンペーンのデータを用いる。
  • 可用性推定値の不確実性を推定するため、σ ≈ √[p₁(1−p₁)/y₁] の式を用いた統計的信頼区間を適用する。
  • 障害が検出されない確率を、一様分布の仮定に基づきモデル化する:T > L の場合、P_nodet = 1 − L/T となる。
  • 10〜11分のプローブ間隔未満の短時間障害が、無視されがちなことによる故障回数の歪みを分析する。
  • 障害継続時間分布の適切な統計モデルの欠如が、SLA違反および補償分析に深刻な影響を及ぼすことを強調する。

実験結果

リサーチクエスチョン

  • RQ1ICMPベースのクラウド可用性測定は、HTTPベースの測定と比較して、実際のクラウド障害をどれほど正確に検出できるか?
  • RQ210〜11分の低頻度プローブが、一時的なクラウド障害をどれほど無視する可能性があるか?
  • RQ310〜11分のプローブ間隔未満の短時間障害が、障害継続時間分布の統計的推定にどのように歪みをもたらすか?
  • RQ4現在の測定手法は、SLA違反の検出および補償請求の根拠として信頼できるか?
  • RQ5正確なSLA適合性評価および保険請求の数量化を実現するためには、どのようなプローブ頻度および統計モデルの改善が必要か?

主な発見

  • HTTPベースのプローブ手法は、誤ルーティングや一時的なパケット損失などのネットワーク関連障害をフィルタリングできるため、ICMPよりも正確である。
  • 最初の試行のみに基づく可用性推定値は、2と3の9(すなわち、約99.9%から約99.99%)の間にある。
  • Amazonの可用性推定値の標準偏差は約8.2×10⁻⁵、Googleのそれは約5.8×10⁻⁵であり、高い精度を示すが、99.999%未満のパフォーマンスの検出には不十分である。
  • 10〜11分のプローブ間隔未満の障害は、検出されない確率が無視できないほど高く、T > L の場合、P_nodet = 1 − L/T となる。
  • 障害検出回数および長時間障害の回数は、閾値がプローブ間隔を上回らない限り、著しく低く見積もられる。
  • 適切な障害継続時間分布のモデル化が欠如しているため、SLA違反の正確な評価、および補償または保険請求の可能性の評価が困難である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。