Skip to main content
QUICK REVIEW

[論文レビュー] Robust Data Preprocessing for Machine-Learning-Based Disk Failure Prediction in Cloud Production Environments

Shujie Han, Jun Wu|arXiv (Cornell University)|Dec 20, 2019
Cloud Computing and Resource Management参考文献 35被引用数 11
ひとこと要約

Rodman は、クラウドプロダクション環境における現実世界のデータ品質問題に対処する、機械学習ベースのディスク障害予測に向けた頑健なデータ前処理パイプラインです。SMARTログ、syslog、障害チケットに対して、障害タイプのフィルタリング、スプラインベースのデータ補完、自動化された前駆動障害バックトラッキングを適用することで、AlibabaおよびBackblazeのデータセットにおいて、ベースラインモデル比で予測精度を最大20%向上させます。

ABSTRACT

To provide proactive fault tolerance for modern cloud data centers, extensive studies have proposed machine learning (ML) approaches to predict imminent disk failures for early remedy and evaluated their approaches directly on public datasets (e.g., Backblaze SMART logs). However, in real-world production environments, the data quality is imperfect (e.g., inaccurate labeling, missing data samples, and complex failure types), thereby degrading the prediction accuracy. We present RODMAN, a robust data preprocessing pipeline that refines data samples before feeding them into ML models. We start with a large-scale trace-driven study of over three million disks from Alibaba Cloud's data centers, and motivate the practical challenges in ML-based disk failure prediction. We then design RODMAN with three data preprocessing echniques, namely failure-type filtering, spline-based data filling, and automated pre-failure backtracking, that are applicable for general ML models. Evaluation on both the Alibaba and Backblaze datasets shows that RODMAN improves the prediction accuracy compared to without data preprocessing under various settings.

研究の動機と目的

  • 生産環境におけるデータ品質の悪さにより生じる、現実世界のディスク障害予測のギャップを埋める。
  • 不正確なラベル付け、不完全なデータセット、多様な障害タイプの3つの主要なデータ品質課題を特定・解決する。
  • あらゆる機械学習モデルに適用可能な汎用的な前処理パイプラインを開発する。
  • Alibaba Cloudおよび公開のBackblazeデータセットから得た大規模かつ現実世界のディスクデータを用いて、前処理の有効性を検証する。
  • モデル革新よりもデータ品質の最適化が、予測精度の向上に与える影響が大きいことを示す。

提案手法

  • Alibaba Cloudの300万枚を超えるディスクを対象とした大規模なトレース駆動型研究を通じて、現実世界のデータ品質問題を同定する。
  • 障害タイプのフィルタリングを実装し、統計的に予測可能な障害タイプ(明確な前駆動パターンを示すもの)のみを正例として選別する。
  • 立方スプライン補間を用いて欠損したSMARTログ値を補完し、急激な変化を保持するとともに、データの連続性を向上させる。
  • 自動化された前駆動障害バックトラッキングを実行し、実際の障害発生の前に対象となる異常(例:隠れセクターエラー)を正例としてラベル付ける。
  • SMARTログとシステムログ(syslog)および障害チケットを照合することで、障害ラベル付けの正確性を向上させ、非停止型障害タイプを特定する。
  • 洗練されたデータを任意の標準的な機械学習モデルに統合し、トレーニングおよび評価を実施することで、互換性と一般化性能を確保する。

実験結果

リサーチクエスチョン

  • RQ1不正確なラベル付け、欠損データ、多様な障害タイプといった現実世界のデータ品質問題が、機械学習ベースのディスク障害予測の性能に与える影響は何か?
  • RQ2統一されたデータ前処理パイプラインは、異なる機械学習モデルおよびデータセットにおいて予測精度を向上させることができるか?
  • RQ3故障停止型障害に加えて、前駆動異常(例:隠れセクターエラー)を正例として含めることで、予測性能にどのような影響があるか?
  • RQ4スプラインベースの補間は、予測性能を低下させることなく、欠損したSMARTデータを効果的に回復させることができるか?
  • RQ5自動化された前駆動障害バックトラッキングは、障害予測における再現率(recall)およびF1スコアにどの程度効果をもたらすか?

主な発見

  • Alibabaデータセットでは、Rodmanがベースラインモデル比で真正陽性率(TPR)を最大20%向上させ、ディスクモデルA1では92.8%、B1では68.4%を達成した。
  • Backblazeデータセットでは、RodmanはディスクモデルA2で96.4%、B2で63.2%のTPRを達成したのに対し、ベースラインはそれぞれ70.6%および43.9%であった。
  • 2か月から10か月までの異なるトレーニング期間においても、パイプラインは一貫した精度向上を示し、A1とB1ではそれぞれ20%および10%のTPR向上を達成した。
  • 障害タイプのフィルタリングにより、予測不能な障害タイプが除外され、ノイズが著しく低減され、より信頼性の高いモデル学習が可能になった。
  • スプラインベースのデータ補完により、欠損したSMART値が効果的に回復され、急激な変化が保持され、モデルの一般化性能が向上した。
  • 自動化された前駆動障害バックトラッキングにより、前駆動異常を正例としてラベル付けすることで、障害の早期検出が可能になり、モデルの故障発生への感受性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。