Skip to main content
QUICK REVIEW

[論文レビュー] Transparently Capturing Request Execution Path for Anomaly Detection

Yong Yang, Long Wang|arXiv (Cornell University)|Jan 20, 2020
Software System Performance and Reliability参考文献 24被引用数 5
ひとこと要約

本稿では、分散クラウドおよびビッグデータシステムにおけるエンドツーエンドのリクエスト実行パスを把握する、透明性が高く低オーバーヘッドな手法REPTraceを提案する。多様な実行シナリオを分析し、原則に基づいたトレーシングアルゴリズムを適用することで、4つのプロダクショングレードのプラットフォームで最小限の遅延と無視できるネットワークオーバーヘッドを実現しながら、96%の再現率を達成する正確な異常検出を可能にする。

ABSTRACT

With the increasing scale and complexity of cloud systems and big data analytics platforms, it is becoming more and more challenging to understand and diagnose the processing of a service request in such distributed platforms. One way that helps to deal with this problem is to capture the complete end-to-end execution path of service requests among all involved components accurately. This paper presents REPTrace, a generic methodology for capturing such execution paths in a transparent fashion. We analyze a comprehensive list of execution scenarios, and propose principles and algorithms for generating the end-to-end request execution path for all the scenarios. Moreover, this paper presents an anomaly detection approach exploiting request execution paths to detect anomalies of the execution during request processing. The experiments on four popular distributed platforms with different workloads show that REPTrace can transparently capture the accurate request execution path with reasonable latency and negligible network overhead. Fault injection experiments show that execution anomalies are detected with high recall (96%).

研究の動機と目的

  • 大規模で複雑な分散システムにおけるサービスリクエスト処理の診断の難しさに対処すること。
  • 分散プラットフォームのすべてのコンポonentにわたり、正確なエンドツーエンドのリクエスト実行パスの追跡を可能にすること。
  • 最小限のパフォーマンスオーバーヘッドを伴う、透明なトレーシングメカニズムの開発。
  • リクエスト実行パスの分析により実行上の異常を検出すること。
  • 多様な分散プラットフォームおよびワークロードにおいて、このアプローチを検証すること。

提案手法

  • REPTraceは、分散システム内のすべてのコンポonentにわたり完全なリクエスト実行パスをキャプチャする汎用的手法を採用する。
  • 分岐、ループ、並列処理を含む多様な実行シナリオに対応するための原則とアルゴリズムを定義する。
  • アプリケーション論理を変更せずにトレースの整合性を維持するために、軽量なインストルメンテーションとコンテキストプロパゲーションを活用する。
  • ネットワークおよびCPUオーバーヘッドを最小限に抑えるために、最適化されたデータ収集および集約を伴う分散トレーシング技術を活用する。
  • 統計的およびパターンベースのモデルを用いて、キャプチャされた実行パスにおける乖離を分析することで異常検出を実施する。
  • システムは透明性を確保しており、既存のサービスやコンポonentに変更を加える必要がない。

実験結果

リサーチクエスチョン

  • RQ1複雑な分散システムにおいて、エンドツーエンドのリクエスト実行パスを正確かつ透明にキャプチャする方法は何か?
  • RQ2複数のコンポonentにわたる多様な実行シナリオに対応するための原則とアルゴリズムは何か?
  • RQ3キャプチャされたパスを用いて、高い再現率で実行時の異常を効果的に検出できるか?
  • RQ4実世界の分散プラットフォームにおける、提案されたトレーシングメカニズムのパフォーマンスオーバーヘッドはどの程度か?
  • RQ5故障挿入および多様なワークロード下で、異常検出メカニズムの性能はどのようになるか?

主な発見

  • REPTraceは、4つの一般的な分散プラットフォームにおいて、無視できるネットワークおよびCPUオーバーヘッドで正確なエンドツーエンドのリクエスト実行パスをキャプチャすることに成功した。
  • 低遅延を実現しており、リアルタイム環境におけるプロダクションデプロイメントに適している。
  • 故障挿入実験により、キャプチャされたパスを用いて96%の再現率で実行異常を検出できた。
  • このアプローチは透明であり、既存のサービスやコンポonentに変更を加える必要がない。
  • クラウドおよびビッグデータプラットフォームを含む、さまざまなワークロードやシステムアーキテクチャにうまく一般化できる。
  • 異常検出メカニズムは実行フローの乖離を効果的に同定でき、早期の障害診断を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。