Skip to main content
QUICK REVIEW

[논문 리뷰] RLScheduler: An Automated HPC Batch Job Scheduler Using Reinforcement Learning

Di Zhang, Dong Dai|arXiv (Cornell University)|2019. 10. 20.
Cloud Computing and Resource Management참고 문헌 42인용 수 4
한 줄 요약

RLScheduler는 시도와 실수를 통해 최고 수준의 스케줄링 정책을 자동으로 학습하는 강화학습 기반의 HPC 배치 작업 스케줄러로, 전문가의 간섭을 최소화한다. 다양한 워크로드와 최적화 목표에서 전통적 스케줄러를 능가하며, 커널 기반 신경망과 궤적 필터링을 통해 효율적이고 견고한 학습을 통해 예측 불가능한 워크로드에도 안정적인 성능을 보인다.

ABSTRACT

Today high-performance computing (HPC) platforms are still dominated by batch jobs. Accordingly, effective batch job scheduling is crucial to obtain high system efficiency. Existing HPC batch job schedulers typically leverage heuristic priority functions to prioritize and schedule jobs. But, once configured and deployed by the experts, such priority functions can hardly adapt to the changes of job loads, optimization goals, or system settings, potentially leading to degraded system efficiency when changes occur. To address this fundamental issue, we present RLScheduler, an automated HPC batch job scheduler built on reinforcement learning. RLScheduler relies on minimal manual interventions or expert knowledge, but can learn high-quality scheduling policies via its own continuous 'trial and error'. We introduce a new kernel-based neural network structure and trajectory filtering mechanism in RLScheduler to improve and stabilize the learning process. Through extensive evaluations, we confirm that RLScheduler can learn high-quality scheduling policies towards various workloads and various optimization goals with relatively low computation cost. Moreover, we show that the learned models perform stably even when applied to unseen workloads, making them practical for production use.

연구 동기 및 목표

  • 고정된 수동 튜닝 우선순위 함수에 의존하는 전통적 HPC 스케줄러의 유연성 부족 문제를 해결하기 위해.
  • 변화하는 워크로드와 최적화 목표에 동적으로 대응할 수 있는 자동화되고 적응형 작업 스케줄링을 가능하게 하기 위해.
  • 강화학습이 전문가의 간섭 없이 안정적이고 고성능의 스케줄링 정책을 학습할 수 있는지 평가하기 위해.
  • RL 기반 스케줄러 성능에 영향을 주는 핵심 요소를 규명하고 학습 효율성 및 견고성 향상을 위한 해결책을 제안하기 위해.

제안 방법

  • RLScheduler는 작업 제출 시간, 요청한 프로세서 수, 실행 시간과 같은 작업 속성에 기반해 작업 우선순위를 할당하기 위해 강화학습으로 훈련된 딥 Q네트워크(DQN) 에이전트를 사용한다.
  • 다양한 작업 워크로드에서 정책 표현과 일반화 능력을 향상시키기 위해 커널 기반의 딥 신경망을 도입한다.
  • 학습 데이터의 노이즈와 분산을 줄여 학습 과정을 안정화시키기 위해 궤적 필터링 메커니즘을 사용한다.
  • 시스템 수준 메트릭인 작업 처리량, 대기 시간, 자원 활용도와 같은 희소 보상 기반으로 스케줄러를 훈련시킨다.
  • 합성 및 실제 워크로드 트레이스를 사용해 훈련을 수행하고, 일반화 능력을 테스트하기 위해 미사용된 워크로드로 평가한다.
  • 백필링 및 비백필링 조건 모두에서 시스템을 평가하여 다양한 구현 환경에서의 견고성을 평가한다.

실험 결과

연구 질문

  • RQ1강화학습이 다양한 워크로드와 최적화 목표에서 최신 히우리스틱 스케줄러를 능가하거나 이를 충족하는 고품질의 스케줄링 정책을 학습할 수 있는가?
  • RQ2학습 중에 볼 수 없었던 새로운 작업 워크로드에 대해 학습된 RL 정책이 효과적으로 일반화되는가?
  • RQ3RL 기반 HPC 스케줄러의 학습 효율성과 성능 안정성에 영향을 주는 핵심 요소는 무엇인가?
  • RQ4신경망 아키텍처와 학습 데이터의 분산은 학습된 스케줄링 정책의 확장성과 견고성에 어떻게 영향을 미치는가?

주요 결과

  • RLScheduler는 실제 및 합성 워크로드 다수에서 FCFS, SJF, WFP3, UNICEP와 같은 최신 스케줄러와 비교해 동등하거나 뛰어난 스케줄링 성능을 달성했다.
  • 백필링 조건에서 Lublin-1 트레이스를 사용한 결과, RLScheduler는 평균 작업 대기 시간을 12,460초로 줄여 FCFS(24,887초) 및 기타 스케줄러를 능가했다.
  • 백필링 없이 HPC2N에서의 작업 감속 지표로 RLScheduler는 270.7을 기록했으며, FCFS(13,938)와 UNICEP(29,633)를 크게 앞서며 뛰어난 성능을 보였다.
  • 모델는 새로운 워크로드에 대해 잘 일반화되었으며, 한 트레이스에서 훈련하고 다른 트레이스에서 테스트했을 때도 안정적인 성능을 유지해 강력한 일반화 능력을 입증했다.
  • 커널 기반 신경망과 궤적 필터링 메커니즘이 학습 안정성과 수렴 속도를 크게 향상시켜 정책 학습의 분산을 감소시켰다.
  • 훈련 중 계산 비용이 낮게 유지되었고, 처리량, 대기 시간, 감속 지표 등 다양한 메트릭에서 높은 성능을 유지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.