Skip to main content
QUICK REVIEW

[论文解读] Robust Data Preprocessing for Machine-Learning-Based Disk Failure Prediction in Cloud Production Environments

Shujie Han, Jun Wu|arXiv (Cornell University)|Dec 20, 2019
Cloud Computing and Resource Management参考文献 35被引用 11
一句话总结

Rodman 是一种用于基于机器学习的磁盘故障预测的稳健数据预处理流水线,解决了云生产环境中真实世界的数据质量问题。通过应用故障类型过滤、基于样条的缺省数据填充以及对 SMART 日志、系统日志和故障工单的自动化故障前回溯,Rodman 在阿里巴巴和 Backblaze 数据集上将基线模型的预测准确率最高提升了 20%。

ABSTRACT

To provide proactive fault tolerance for modern cloud data centers, extensive studies have proposed machine learning (ML) approaches to predict imminent disk failures for early remedy and evaluated their approaches directly on public datasets (e.g., Backblaze SMART logs). However, in real-world production environments, the data quality is imperfect (e.g., inaccurate labeling, missing data samples, and complex failure types), thereby degrading the prediction accuracy. We present RODMAN, a robust data preprocessing pipeline that refines data samples before feeding them into ML models. We start with a large-scale trace-driven study of over three million disks from Alibaba Cloud's data centers, and motivate the practical challenges in ML-based disk failure prediction. We then design RODMAN with three data preprocessing echniques, namely failure-type filtering, spline-based data filling, and automated pre-failure backtracking, that are applicable for general ML models. Evaluation on both the Alibaba and Backblaze datasets shows that RODMAN improves the prediction accuracy compared to without data preprocessing under various settings.

研究动机与目标

  • 解决由于生产环境中数据质量差导致的现实世界磁盘故障预测中的差距。
  • 识别并解决三个关键数据质量问题:标签不准确、数据集不完整以及故障类型多样化。
  • 开发一种适用于任何机器学习模型的通用预处理流水线,用于磁盘故障预测。
  • 在阿里巴巴云和公开的 Backblaze 数据集上大规模真实磁盘数据上验证预处理方法的有效性。
  • 证明数据质量优化对提升预测准确率的影响大于模型创新。

提出的方法

  • 基于阿里巴巴云超过三百万块磁盘的大规模追踪驱动研究,识别真实世界中的数据质量问题。
  • 实施故障类型过滤,仅选择具有明确故障前模式的统计可预测故障类型(如存在明显前兆的故障)作为正样本进行训练。
  • 应用三次样条插值填补缺失的 SMART 日志值,保留突变特征并提升数据连续性。
  • 执行自动化故障前回溯,将故障前异常(如潜在扇区错误)标记为正样本,时间点位于实际故障事件之前。
  • 将 SMART 日志与系统日志(syslogs)和故障工单相关联,以提高故障标签的准确性,并检测非停机型故障。
  • 将清洗后的数据集成到任意标准机器学习模型中进行训练与评估,确保兼容性与泛化能力。

实验结果

研究问题

  • RQ1现实世界中的数据质量问题(如标签不准确、数据缺失、故障类型多样)如何影响基于机器学习的磁盘故障预测性能?
  • RQ2统一的数据预处理流水线是否能提升不同机器学习模型和数据集上的预测准确率?
  • RQ3与仅标记停机型故障事件相比,将故障前异常(如潜在扇区错误)作为正样本包含进来有何影响?
  • RQ4基于样条的插值在不降低预测性能的前提下,对恢复缺失 SMART 数据的有效性如何?
  • RQ5自动化故障前回溯在提升召回率和 F1 分数方面有多大的效果?

主要发现

  • 在阿里巴巴数据集上,Rodman 相较于基线模型将真正例率(TPR)最高提升 20%,其中磁盘型号 A1 的 TPR 达到 92.8%,B1 为 68.4%。
  • 在 Backblaze 数据集上,Rodman 对磁盘型号 A2 的 TPR 达到 96.4%,B2 为 63.2%,而基线模型分别为 70.6% 和 43.9%。
  • 该流水线在不同训练周期(2 至 10 个月)内均保持一致的准确率增益,A1 和 B1 的 TPR 提升分别为 20% 和 10%。
  • 故障类型过滤显著减少了噪声,通过排除不可预测的故障类型,提升了模型训练的可靠性。
  • 基于样条的数据填充能有效恢复缺失的 SMART 值,保留突变特征,提升模型泛化能力。
  • 自动化故障前回溯通过标记故障前异常,使模型能更早检测到故障,提升对即将发生故障的敏感性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。