Skip to main content
QUICK REVIEW

[논문 리뷰] Failure Data Analysis of HPC Systems

Charng‐Da Lu|arXiv (Cornell University)|2013. 02. 20.
Distributed and Parallel Computing Systems참고 문헌 6인용 수 15
한 줄 요약

이 논문은 NCSA의 세 대의 HPC 시스템에서 수집한 실제 고장 데이터(8–24개월 분량)를 분석하여, 98.7–99.8%의 가용성을 확인했으며, 고장의 대부분은 소프트웨어 정지로 인해 발생하지만, 하드웨어 정지와 유지보수로 인한 정지 시간이 가장 길었다. 비지수 분포와 상관 고장 이벤트를 규명하여 대규모 HPC 시스템의 신뢰성 모델링에 중요한 통찰을 제공한다.

ABSTRACT

Continuous availability of HPC systems built from commodity components have become a primary concern as system size grows to thousands of processors. In this paper, we present the analysis of 8-24 months of real failure data collected from three HPC systems at the National Center for Supercomputing Applications (NCSA) during 2001-2004. The results show that the availability is 98.7-99.8% and most outages are due to software halts. On the other hand, the downtime are mostly contributed by hardware halts or scheduled maintenance. We also used failure clustering analysis to identify several correlated failures.

연구 동기 및 목표

  • 컴modity 구성 요소로 구성된 대규모 HPC 시스템의 고장 행동을 이해하여 시스템 신뢰성을 향상시키기 위해.
  • 정지의 근본 원인과 시스템 가용성 및 정지 시간에 미치는 영향을 규명하기 위해.
  • 고장 분포를 분석하고 상관 고장을 탐지하여 보다 나은 신뢰성 모델링과 시스템 설계를 지원하기 위해.
  • 성능 및 가용성 모델을 검증하고 HPC 환경에서의 스케줄링 및 자원 특성 분석을 지원하기 위해 실증적 데이터를 제공하기 위해.

제안 방법

  • 8–24개월 동안 세 대의 HPC 시스템—SGI Origin 2000(O2K), Platinum Beowulf 클러스터, Titan Beowulf 클러스터—에서 실제 고장 로그를 수집하였다.
  • 정지를 다섯 가지 유형으로 분류: 소프트웨어 정지(SW), 하드웨어 정지(HW), 계획적 유지보수(M), 전원/에어컨 정지(PWR), 네트워크 정지(0건 발생으로 제외함).
  • 일일 고장 로그를 기반으로 주요 지표인 가용성(%), 정지 시간(일수), 고장 간 평균 시간(MTBF), 복구 평균 시간(MTTR)을 계산하였다.
  • 고장 간격 시간(TBF)과 복구 시간(TTR)에 대한 통계 분석을 수행하여 포아송 분포 및 무거운 尾 비례 분포 여부를 테스트하였다.
  • 시간적 패턴과 노드 간 대규모 정지 이벤트를 분석하여 고장 집중 현상(고장 상관성)을 탐지하기 위한 고장 집중 분석을 수행하였다.
  • 시스템 고유의 데이터(작업 스케줄링 제약 조건 및 하드웨어 구성)를 활용하여 고장 영향을 맥락화하고 결과를 검증하였다.

실험 결과

연구 질문

  • RQ1컴modity 구성 요소로 구성된 대규모 HPC 시스템의 실제 가용성은 얼마이며, 다양한 시스템 아키텍처 간에 어떻게 달라지나?
  • RQ2고장 유형 중 소프트웨어, 하드웨어, 유지보수 중 어떤 것이 가장 빈번한가? 그리고 정지 시간에 가장 큰 영향을 미치는 것은 무엇인가?
  • RQ3고장 간격 시간(TBF)과 복구 시간(TTR)은 지수 분포를 따르는가, 아니면 중량 꼬리(heavy-tailed) 행동을 보이는가?
  • RQ4노드 간에 고장 상관성 패턴이 존재하는가? 만약 존재한다면 원인과 시간적 특성은 무엇인가?
  • RQ5주요 기계형 시스템과 PC 클러스터 간 고장 패턴은 어떻게 다를 수 있으며, 이는 신뢰성 모델링에 어떤 영향을 미치는가?

주요 결과

  • HPC 시스템의 가용성은 98.7%에서 99.8% 사이였으며, O2K 시스템은 98.7%를 기록했고, Titan은 99.8%를 달성했다.
  • 소프트웨어 정지가 정지의 대부분(전체 정지의 59%)을 차지했지만, 하드웨어 정지와 계획적 유지보수로 인한 정지 시간이 가장 길었다.
  • MTBF 값은 상당한 차이를 보였다: O2K는 1.0일의 MTBF를 기록했고, Titan은 18.5일로 PC 클러스터의 높은 신뢰성을 반영했다.
  • 모든 시스템의 TBF와 TTR 분포는 중량 꼬리 행동을 보였으며, 이는 지수 분포 가정과 배치된다는 점을 시사한다.
  • 모든 시스템에서 고장 상관성이 확인되었으며, O2K는 소프트웨어 및 하드웨어 문제로 인한 집중 현상을 보였고, Titan은 전원 장애와 소프트웨어 정지로 인해 세 차례의 주요 고장 집중이 발생했다.
  • 계획적 유지보수는 예측 가능하나, 정지 시간에 상당한 기여를 하였다—M4에서는 최대 49%, M2 노드에서는 최대 75%의 정지 시간을 차지하여 시스템 가용성에 미치는 영향이 뚜렷했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.