Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Data Preprocessing for Machine-Learning-Based Disk Failure Prediction in Cloud Production Environments

Shujie Han, Jun Wu|arXiv (Cornell University)|2019. 12. 20.
Cloud Computing and Resource Management참고 문헌 35인용 수 11
한 줄 요약

Rodman는 클라우드 프로덕션 환경에서의 실제 데이터 품질 문제를 해결하는 강력한 기계학습 기반 디스크 장애 예측을 위한 데이터 전처리 파이프라인이다. SMART 로그, 시스템 로그(syslogs), 장애 티켓과 같은 데이터에 실패 유형 필터링, 스퍼링 기반 데이터 보정, 자동화된 사전 장애 추적을 적용하여, 알리바바 및 백블루 데이터셋에서 기준 모델 대비 예측 정확도를 최대 20% 향상시킨다.

ABSTRACT

To provide proactive fault tolerance for modern cloud data centers, extensive studies have proposed machine learning (ML) approaches to predict imminent disk failures for early remedy and evaluated their approaches directly on public datasets (e.g., Backblaze SMART logs). However, in real-world production environments, the data quality is imperfect (e.g., inaccurate labeling, missing data samples, and complex failure types), thereby degrading the prediction accuracy. We present RODMAN, a robust data preprocessing pipeline that refines data samples before feeding them into ML models. We start with a large-scale trace-driven study of over three million disks from Alibaba Cloud's data centers, and motivate the practical challenges in ML-based disk failure prediction. We then design RODMAN with three data preprocessing echniques, namely failure-type filtering, spline-based data filling, and automated pre-failure backtracking, that are applicable for general ML models. Evaluation on both the Alibaba and Backblaze datasets shows that RODMAN improves the prediction accuracy compared to without data preprocessing under various settings.

연구 동기 및 목표

  • 실제 생산 환경에서의 낮은 데이터 품질로 인한 기계학습 기반 디스크 장애 예측의 격차를 해결한다.
  • 불확실한 레이블링, 완전하지 않은 데이터셋, 다양한 장애 유형과 같은 세 가지 핵심 데이터 품질 문제를 식별하고 해결한다.
  • 모든 기계학습 모델에 적용 가능한 일반 목적의 전처리 파이프라인을 개발한다.
  • 알리바바 클라우드 및 공개된 백블루 데이터셋으로부터의 대규모 실세계 디스크 데이터를 활용해 전처리의 효과를 검증한다.
  • 모델 혁신보다 데이터 품질 개선이 예측 정확도 향상에 더 큰 영향을 미친다는 것을 입증한다.

제안 방법

  • 알리바바 클라우드의 300만 대 이상의 디스크를 대상으로 대규모 추적 기반 연구를 수행하여 실제 데이터 품질 문제를 규명한다.
  • 실패 유형 필터링을 통해 통계적으로 예측 가능한 장애 유형(예: 명확한 사전 장애 패턴이 있는 유형)만 정규화된 학습 샘플로 선별한다.
  • 삼차 스퍼링 보간법을 적용하여 누락된 SMART 로그 값을 보정함으로써 급격한 변화를 유지하고 데이터의 연속성을 향상시킨다.
  • 자동화된 사전 장애 추적을 통해 실제 장애 발생 이전에 장애 징후(예: 잠재적 섹터 오류)를 긍정 샘플로 레이블링한다.
  • SMART 로그를 시스템 로그(syslogs) 및 장애 티켓과 연계하여 장애 레이블링 정확도를 향상시키고, 장애 정지형이 아닌 장애 유형을 탐지한다.
  • 개선된 데이터를 표준 기계학습 모델에 통합하여 학습 및 평가를 수행함으로써 호환성과 일반화 능력을 확보한다.

실험 결과

연구 질문

  • RQ1실제 데이터 품질 문제—예: 잘못된 레이블링, 누락된 데이터, 다양한 장애 유형—은 기계학습 기반 디스크 장애 예측 성능에 어떤 영향을 미치는가?
  • RQ2통합된 데이터 전처리 파이프라인은 다양한 기계학습 모델과 데이터셋에서 예측 정확도 향상에 기여하는가?
  • RQ3사전 장애 이상(예: 잠재적 섹터 오류)을 긍정 샘플로 포함시키는 것과 실패 정지 이벤트만 레이블링하는 것의 성능 차이는 무엇인가?
  • RQ4스퍼링 기반 보간법은 예측 성능 저하 없이 누락된 SMART 데이터를 얼마나 효과적으로 복원하는가?
  • RQ5자동화된 사전 장애 추적은 예측 정확도의 재현율(recall)과 F1 점수에 얼마나 기여하는가?

주요 결과

  • 알리바바 데이터셋에서 Rodman는 기준 모델 대비 최대 20%의 진짜 양성 비율(TPR) 향상을 기록했으며, 디스크 모델 A1의 TPR은 92.8%, B1의 TPR은 68.4%를 기록했다.
  • 백블루 데이터셋에서 Rodman는 디스크 모델 A2의 TPR이 96.4%로 기준 모델의 70.6% 대비 향상되었고, B2의 TPR은 63.2%로 기준 모델의 43.9% 대비 향상되었다.
  • 학습 기간(2~10개월)에 관계없이 일관된 정확도 향상을 유지했으며, A1과 B1의 TPR 향상률은 각각 20%와 10%였다.
  • 실패 유형 필터링은 예측 불가능한 장애 유형을 제거하여 노이즈를 크게 줄여 더 신뢰할 수 있는 모델 학습을 가능하게 했다.
  • 스퍼링 기반 데이터 보정은 누락된 SMART 값의 복원에 효과적이며, 급격한 변화를 유지하고 모델의 일반화 능력을 향상시켰다.
  • 자동화된 사전 장애 추적을 통해 사전 장애 이상을 레이블링함으로써 장애 발생 이전에 조기에 장애를 탐지할 수 있었고, 모델의 임박한 장애 감지 민감도가 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.