QUICK REVIEW
[논문 리뷰] Mistral Supercomputer Job History Analysis
Michał Zasadziński, Víctor Muntés-Mulero|arXiv (Cornell University)|2018. 01. 23.
AI-based Problem Solving and Planning참고 문헌 1인용 수 3
한 줄 요약
이 논문은 Mistral 페타스케일 슈퍼컴퓨터(3.14 PFLOPS, 3,300개 노드)의 작업 이력을 분석하여 Slurm 스케줄러 데이터, 하드웨어 메트릭스 및 전력 모니터링을 활용해 고장 패턴을 규명한다. 실패한 작업은 완료된 작업보다 훨씬 많은 CPU 시간을 소비하며, 더 많은 노드와 랙(특히 약 7개 랙)을 사용하고, 평균 전력 소비가 낮아, 고장의 조기 탐지가 HPC 환경에서 막대한 자원 절감을 가능하게 함을 시사한다.
ABSTRACT
In this technical report, we show insights and results of operational data analysis from petascale supercomputer Mistral, which is ranked as 42nd most powerful in the world as of January 2018. Data sources include hardware monitoring data, job scheduler history, topology, and hardware information. We explore job state sequences, spatial distribution, and electric power patterns.
연구 동기 및 목표
- 대규모 HPC 시스템에서의 고장 패턴을 조사하여 자원 활용도와 시스템 신뢰성을 향상시키기 위해.
- 페타스케일 슈퍼컴퓨터에서 작업 특성(예: 노드 수, 랙 수, 지속 시간 등)과 고장 상태 간의 상관관계를 규명하기 위해.
- 다양한 작업 완료 상태에서의 전력 소비 추세를 분석하여 임박한 고장을 시사하는 이면적 이상을 탐지하기 위해.
- 작업 크기와 하드웨어 구성이 고장 발생 가능성과 지속 시간에 미치는 영향을 이해하기 위해.
- 실제 HPC 환경에서의 운영 데이터를 활용해 복잡한 IT 시스템의 근본 원인 분석을 지원하기 위해.
제안 방법
- Mistral 슈퍼컴퓨터에서 10개월간의 생산 사용 기간 동안의 작업 스케줄러 로그(Slurm)를 수집하고 처리함.
- DKRZ 데이터센터에서의 하드웨어 모니터링 데이터, 전력 메트릭스 및 토폴로지 정보(랙, 케이스, 노드 유형)를 통합함.
- 작업 상태 시퀀스, 공간 분포(랙 및 노드), 그리고 다양한 작업 유형에 따른 전력 소비 패턴을 분석함.
- 하드웨어 프로파일(예: B720_36_64, B720_24_256)별로 그룹화하여, 완료 전 300초 동안의 평균 전력을 계산함.
- 통계 분석 및 시각화(예: 고장 확률 대 랙 수 그래프)를 통해 추세를 탐지함.
- 작업 우선순위, 지속 시간, 고장 상태 간의 상관관계를 평가하여 고위험 우선순위 타임아웃과 같은 이면적 이상을 식별함.
실험 결과
연구 질문
- RQ1할당된 노드 수, 랙 수와 작업 고장 가능성 간의 관계는 무엇인가?
- RQ2특히 마지막 300초 동안, 완료된 작업, 실패한 작업, 취소된 작업 간의 전력 소비 패턴은 어떻게 다를까?
- RQ3작업 지속 시간 또는 크기와 고장 가능성 간의 상관관계는 있는가? 특정 임계값에서 고장 확률이 증가하는 지점이 존재하는가?
- RQ4특정 고장 상태(예: 타임아웃)에서 작업 우선순위 분포에 눈에 띄는 이상이 존재하는가?
- RQ5공간 분포(예: 사용된 랙 수)는 고장 발생 빈도와 지속 시간에 어떤 영향을 미치는가?
주요 결과
- 완료된 작업은 전체 제출 건수의 91.3%를 차지했고, 실패한 작업은 5.6%를 차지하였으며, 취소된 작업은 1.7%, 타임아웃은 1.4%였다.
- 실패한 단계는 평균 18개의 노드를 사용한 반면, 완료된 단계는 평균 3.4개의 노드를 사용하여, 고장 난 작업의 복잡도가 더 높음을 시사한다.
- 7개의 랙을 사용할 경우 고장 확률이 최고조에 이르며, 13개 랙 이상(1,000개 이상의 노드)을 할당한 경우 고장은 극히 드물게 발생한다.
- 10개 랙 이하를 사용한 경우 실패한 작업은 완료된 작업보다 지속 시간이 짧았고, 12개 랙 초과의 경우 실패한 작업은 상당히 더 길었다.
- 실패한 작업은 완료된 작업보다 더 많은 CPU 시간을 소비하였으며, 완료된 단계의 평균 지속 시간은 약 414초, 실패한 단계는 거의 3배에 달했다.
- 마지막 300초 동안의 전력 소비는 실패한 작업에서 일관되게 낮았는데, 예를 들어 B720-compute_36_64의 경우 실패한 작업은 172W, 완료된 작업은 176W였다. 이는 고장 이후 조기에 비어 있는 상태가 되었음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.