[論文レビュー] Constructing Large-Scale Real-World Benchmark Datasets for AIOps
本論文は、大手企業の本番システムから収集した大規模で現実的なAIOpsベンチマークデータセットを3つ紹介している。これらは、KPIの異常検出、多次元データにおける原因究明、障害診断の3つの分野をカバーしており、年次コンペティションで数百名の参加者を惹きつけた。これらのデータセットは、真の障害要因が事前に注入された現実的で大規模かつ公開可能なデータを提供することで、AIOps研究の標準化と進展を可能にする。
Recently, AIOps (Artificial Intelligence for IT Operations) has been well studied in academia and industry to enable automated and effective software service management. Plenty of efforts have been dedicated to AIOps, including anomaly detection, root cause localization, incident management, etc. However, most existing works are evaluated on private datasets, so their generality and real performance cannot be guaranteed. The lack of public large-scale real-world datasets has prevented researchers and engineers from enhancing the development of AIOps. To tackle this dilemma, in this work, we introduce three public real-world, large-scale datasets about AIOps, mainly aiming at KPI anomaly detection, root cause localization on multi-dimensional data, and failure discovery and diagnosis. More importantly, we held three competitions in 2018/2019/2020 based on these datasets, attracting thousands of teams to participate. In the future, we will continue to publish more datasets and hold competitions to promote the development of AIOps further.
研究の動機と目的
- AIOps研究における公開で大規模かつ現実的なデータセットの不足が、提案手法の公平な比較や現実世界への一般化を制限しているという問題に対処すること。
- KPIの異常検出、多次元的要因究明、障害診断を含む多様なAIOpsシナリオをカバーする包括的なベンチマークデータセットを提供すること。
- 学界と産業界のチームが参加する年次AIOpsアルゴリズムコンペティションを主催することで、コミュニティ全体の研究開発を促進すること。
- 真の障害要因が事前に注入された公開データを用いることで、AIOps技術の再現可能で標準化された評価を可能にすること。
- 継続的なデータセットの公開とコンペティションの範囲拡大を通じて、AIOps分野の長期的成長を支援すること。
提案手法
- 騰訊(Tencent)、eBay、浙江チャイナモバイルなどの産業パートナーの本番システムから、トレース、KPI、メトリクスを含む現実の監視データを収集すること。
- CPUストレス、ネットワーク遅延、データベースポートのクローズなど7種類の障害タイプにわたり、合計169件の制御された障害を注入し、原因が明確な真の障害イベントを生成すること。
- KPI異常検出用、トレースとメトリクスを用いた多次元的要因究明用、包括的な障害発見と診断用の3つの異なるデータセットを設計すること。
- OpenTracing仕様に従ったデータフォーマットの標準化により、分散型コンポONENT間での追跡可能性と因果関係モデリングを確保すること。
- オンラインでの障害検出と診断タスクを含むコンペティションフレームワークを実装し、参加チームは時間的要因とF-0.5スコアに基づいて順位付けられた原因究明予測を提出すること。
- データセットとコンペティションの結果(最良のソリューションを含む)を公開することで、AIOps研究における透明性と再現可能性を促進すること。
実験結果
リサーチクエスチョン
- RQ1大規模で現実的なデータセットは、プライベートまたは合成データセットと比較して、AIOpsモデルの一般化性能と信頼性を向上させることができるか?
- RQ2公開ベンチマークは、異常検出や原因究明といった多様なシナリオにおいて、AIOpsアルゴリズムの公平で標準化された評価をどの程度可能にするか?
- RQ3機械学習モデルは、リアルタイムで本番環境に近い環境において、注入された障害をどの程度効果的に検出・診断できるか?
- RQ4公開コンペティションと共有データセットは、AIOps研究におけるコミュニティ参加とイノベーションにどのような影響を与えるか?
- RQ5トレース、KPI、メトリクスを含む多次元データは、複雑な分散型システムにおける原因究明の正確性を向上させるのに効果的に活用できるか?
主な発見
- KPI異常検出、多次元的要因究明、障害診断をカバーする3つのデータセットは、Caiら(2021年)、Yuら(2021年)、Liら(2021年)の研究でも活用されている。
- 2020年のAIOpsチャレンジには141チーム、517名の参加者が集まり、AIOpsベンチマーク分野における強いコミュニティ参加がうかがえる。
- 最良のチームは129件の障害のうち755点(満点1290点)のスコアを達成し、有効な原因究明予測の精度が0.5以上を達成した。
- 真の原因が事前に分かっている障害の注入により、原因が不明な現実の障害データの不足という課題を克服し、障害診断システムの信頼性ある評価が可能になった。
- データセットとコンペティションのおかげで、共通の標準的かつ現実的な評価プラットフォームを提供することで、AIOps研究が著しく前進した。
- 著者らは、多様な障害タイプと複数のコンponent・サービスにわたる現実的な監視データを備えた、本番システムを的確に反映していると確認している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。