Skip to main content
QUICK REVIEW

[논문 리뷰] Predicting batch queue job wait times for informed scheduling of urgent HPC workloads

Nick Brown, Gordon S. Gibb|arXiv (Cornell University)|2022. 04. 28.
Cloud Computing and Resource Management인용 수 9
한 줄 요약

이 논문은 강화된 트리와 확률적 큐 상태 모델링을 사용한 기계학습 접근법을 제안하여 HPC 작업의 시작 시간을 높은 정확도로 예측한다. ARCHER2와 Cirrus에서 실제 시작 시간으로부터 1분 이내의 예측을 65–76% 달성하며, Slurm의 추정기보다 정확도가 최대 18배 높다. 이 방법은 동적 큐 상태와 다단계 분류-회귀 파이프라인을 통합함으로써 예측 성능을 향상시킨다.

ABSTRACT

There is increasing interest in the use of HPC machines for urgent workloads to help tackle disasters as they unfold. Whilst batch queue systems are not ideal in supporting such workloads, many disadvantages can be worked around by accurately predicting when a waiting job will start to run. However there are numerous challenges in achieving such a prediction with high accuracy, not least because the queue's state can change rapidly and depend upon many factors. In this work we explore a novel machine learning approach for predicting queue wait times, hypothesising that such a model can capture the complex behaviour resulting from the queue policy and other interactions to generate accurate job start times. For ARCHER2 (HPE Cray EX), Cirrus (HPE 8600) and 4-cabinet (HPE Cray EX) we explore how different machine learning approaches and techniques improve the accuracy of our predictions, comparing against the estimation generated by Slurm. We demonstrate that our techniques deliver the most accurate predictions across our machines of interest, with the result of this work being the ability to predict job start times within one minute of the actual start time for around 65\% of jobs on ARCHER2 and 4-cabinet, and 76\% of jobs on Cirrus. When compared against what Slurm can deliver, this represents around 3.8 times better accuracy on ARCHER2 and 18 times better for Cirrus. Furthermore our approach can accurately predicting the start time for three quarters of all job within ten minutes of the actual start time on ARCHER2 and 4-cabinet, and for 90\% of jobs on Cirrus. Whilst the driver of this work has been to better facilitate placement of urgent workloads across HPC machines, the insights gained can be used to provide wider benefits to users and also enrich existing batch queue systems and inform policy too.

연구 동기 및 목표

  • 비상 재해 대응 시뮬레이션과 같은 긴급한 작업에 대해 예측할 수 없는 HPC 배치 큐에서의 작업 대기 시간 문제를 해결하기 위해.
  • 일반적으로 정확도가 떨어지고 시스템 간으로 일관성이 없는 Slurm의 내장된 대기 시간 추정 기능을 개선하기 위해.
  • 유동적인 워크로드와 스케줄링 정책을 포함한 복잡한 큐 동역학을 포착할 수 있는 기계학습 모델을 개발하기 위해.
  • 신뢰할 수 있는 시작 시간 예측을 바탕으로 사용자와 HPC 센터가 작업 구성 및 자원 할당에 대해 정보 기반 결정보다 효과적으로 결정을 내릴 수 있도록 하기 위해.
  • 다양한 워크로드와 정책을 가진 다양한 HPC 시스템에 적용 가능한 확장성 있고 데이터 기반의 솔루션을 제공하기 위해.

제안 방법

  • 이 방법은 ARCHER2, Cirrus, 4 케이블 HPE Cray EX를 포함한 세 개의 생산 HPC 시스템에서의 역사적 작업 데이터를 사용해 기계학습 모델을 훈련한다.
  • 실제 대비 요청한 월타임 분포를 기반으로, 각 작업에 대해 100개의 대표적인 큐 워크로드 상태를 생성하기 위해 확률적 샘플링 기법을 사용하여, 제출 시점의 큐 로드에 대한 불확실성을 모델링한다.
  • 정확도를 향상시키기 위해 분류(목표 윈도우 내에 작업이 시작될지 예측)와 회귀(정확한 시작 시간 예측)를 조합한 두 단계 파이프라인을 사용한다.
  • 작업 매개변수와 큐 행동 간의 비선형 관계를 처리하기 위해 기울기 강화 트리(XGBoost 등)를 사용한다.
  • 큐 상태 기능으로는 현재 실행 중인 작업, 대기 중인 작업 및 요청한 월타임을 포함하며, 실시간 예측 불확실성을 반영하기 위해 동적 샘플링을 적용한다.
  • Slurm의 백필 플러그인 추정기와의 비교를 위해 평가하며, 평균 절대 오차 및 예측 윈도우 정확도 등의 지표를 사용한다.

실험 결과

연구 질문

  • RQ1기계학습 모델은 Slurm의 내장 추정기보다 HPC 작업 대기 시간 예측 정확도를 크게 향상시킬 수 있는가?
  • RQ2동적이고 확률적인 큐 상태 표현을 통합할 경우, 변동성이 큰 HPC 워크로드에서 예측 정확도는 어떻게 향상되는가?
  • RQ3다단계 분류-회귀 모델은 정확한 작업 시작 시간을 예측하는 데 있어 단일 모델 접근 방식보다 얼마나 뛰어나게 성능을 발휘하는가?
  • RQ4다른 워크로드와 스케줄링 정책을 가진 다양한 HPC 시스템에서 예측 정확도는 어떻게 달라지는가?
  • RQ5사용자가 작업 구성(예: 노드 수, 월타임)을 최적화해 대기 시간을 줄이기 위해 실질적인 통찰을 제공할 수 있는가?

주요 결과

  • 제안된 모델은 ARCHER2와 4 케이블 시스템에서 실제 시작 시간으로부터 1분 이내의 예측을 65% 달성했으며, Cirrus에서는 76%를 기록하여 Slurm을 크게 능가한다.
  • 10분 정확도 윈도우 기준으로 ARCHER2와 4 케이블 시스템에서는 75%의 작업을 정확히 예측했고, Cirrus에서는 90%를 기록했으며, 이는 Slurm의 성능보다 뛰어나다.
  • 1분 윈도우 내에서 정확도를 측정했을 때, ARCHER2에서는 3.8배, Cirrus에서는 18배 높은 정확도를 기록했다.
  • 다단계 분류-회귀 접근 방식은 기준 모델 대비 작업별 패턴과 큐 상태 동역학을 더 효과적으로 활용함으로써 오차를 감소시켰다.
  • 확률적 큐 상태 샘플링 방법은 실제 세계의 예측 불확실성을 효과적으로 모델링하여 다양한 워크로드에서 모델의 강건성을 향상시켰다.
  • 모델는 VESTEC 긴급 컴퓨팅 시스템에 통합되어 변동성이 크고 시간이 민감한 HPC 워크로드에서 실질적인 활용 가능성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.