[論文レビュー] MicroHECL: High-Efficient Root Cause Localization in Large-Scale Microservice Systems
MicroHECL は、動的サービスコールグラフを構築し、パフォーマンス、信頼性、トラフィックの異常を検出するためにカスタマイズされた機械学習および統計モデルを用い、伝播チェーン分析を高速化するためのプルーニング戦略を適用する、大規模マイクロサービスシステム向けの高効率な根本原因特定システムである。アリババの本番環境では、根本原因特定時間を平均30分から5分に短縮し、トップ3ヒット率は68%を達成した。
Availability issues of industrial microservice systems (e.g., drop of successfully placed orders and processed transactions) directly affect the running of the business. These issues are usually caused by various types of service anomalies which propagate along service dependencies. Accurate and high-efficient root cause localization is thus a critical challenge for large-scale industrial microservice systems. Existing approaches use service dependency graph based analysis techniques to automatically locate root causes. However, these approaches are limited due to their inaccurate detection of service anomalies and inefficient traversing of service dependency graph. In this paper, we propose a high-efficient root cause localization approach for availability issues of microservice systems, called MicroHECL. Based on a dynamically constructed service call graph, MicroHECL analyzes possible anomaly propagation chains, and ranks candidate root causes based on correlation analysis. We combine machine learning and statistical methods and design customized models for the detection of different types of service anomalies (i.e., performance, reliability, traffic). To improve the efficiency, we adopt a pruning strategy to eliminate irrelevant service calls in anomaly propagation chain analysis. Experimental studies show that MicroHECL significantly outperforms two state-of-the-art baseline approaches in terms of both accuracy and efficiency. MicroHECL has been used in Alibaba and achieves a top-3 hit ratio of 68% with root cause localization time reduced from 30 minutes to 5 minutes.
研究の動機と目的
- 大規模産業用マイクロサービスシステムが可用性の問題に直面している際の、遅く不正確な根本原因特定の課題に対処すること。
- 複雑なサービス依存グラフにおける異常伝播チェーン分析の効率を向上させること。
- パフォーマンス、信頼性、トラフィックの異なるタイプのサービス異常を個別にモデル化することで、異常検出の正確性を高めること。
- 関係のないサービスコールを標的としたプルーニング戦略により、誤検出や不要な計算を低減し、根本原因ランク付けの精度を向上させること。
- アリババの電子商取引プラットフォームのような本番環境でリアルタイムで利用可能なスケーラブルかつ導入可能なソリューションを提供すること。
提案手法
- 最近の時間窓内でのリアルタイムのサービス依存関係と品質メトリクス(例:応答時間)を反映する動的サービスコールグラフを構築する。
- パフォーマンス、信頼性、トラフィックの異常を検出するために、機械学習および統計的手法に基づく3つのカスタマイズされたモデルを採用する。
- 初期の異常を示すサービスから始めて、異常なサービスコールに沿った可能性のある異常伝播チェーンを特定するためにサービスコールグラフを走査する。
- 現在の異常伝播経路に対して統計的に無関係なサービスコールエッジを除外するプルーニング戦略を適用し、計算効率を向上させる。
- 候補となるサービスの品質メトリクスと初期の異常を示すサービスのビジネスレベルメトリクスとの相関分析を用いて、候補の根本原因をランク付けする。
- 履歴的およびリアルタイムのメトリクスと因果関係を組み合わせることで、トレースの完全収集を必要とせずに根本原因を推定する。
実験結果
リサーチクエスチョン
- RQ1大規模マイクロサービスシステム(数千のサービスを含む)において、根本原因特定をどのようにしてより効率的に実現できるか?
- RQ2パフォーマンス、信頼性、トラフィックの異なる異常タイプを区別することで、検出正確性にどのような影響を与えるか?
- RQ3統計的相関に基づくプルーニング戦略は、正確性を損なうことなく、検索空間を著しく縮小できるか?
- RQ4機械学習および統計モデルを統合することで、相関分析のみに依存する手法と比較して、異常検出の性能がどのように向上するか?
- RQ5動的サービスコールグラフを用いたグラフベースの伝播分析は、実世界の本番環境における既存の最先端手法をどの程度上回るか?
主な発見
- MicroHECL は、アリババの本番環境で根本原因特定時間を平均30分から5分に短縮した。
- トップ3ヒット率は68%に達し、最先端のベースラインであるMonitorRankおよびMicroscopeを著しく上回った。
- プルーニング戦略により正確性を損なわず効率が向上し、大規模で複雑な依存グラフにおいても迅速な分析が可能になった。
- パフォーマンス、信頼性、トラフィックの異常をそれぞれカスタマイズした検出モデルが、汎用的な相関ベースの手法よりも根本原因の特定をより正確に実現した。
- 本システムは、5か月以上にわたりアリババに導入されており、600件を超える可用性障害を処理し、開発者からの推薦信頼度が非常に高い。
- 実験的評価により、MicroHECL は複数のメトリクスにおいて、MonitorRankおよびMicroscopeを正確性と効率性の両面で上回ることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。