[논문 리뷰] RLScheduler: Learn to Schedule HPC Batch Jobs Using Deep Reinforcement Learning.
RLScheduler는 사전 지식 없이 최적의 스케줄링 정책을 자율적으로 학습하는 HPC 워크로드를 위한 딥 강화학습 기반 작업 스케줄러이다. 다양한 워크로드에 걸쳐 학습된 규칙을 일반화하고 변화하는 목표 및 시스템 조건에 적응함으로써 히ュ리스틱 및 수작업으로 튜닝된 머신러닝 기반 스케줄러를 능가한다.
We present RLScheduler, a deep reinforcement learning based job scheduler for scheduling independent batch jobs in high-performance computing (HPC) environment. From knowing nothing about scheduling at beginning, RLScheduler is able to autonomously learn how to effectively schedule HPC batch jobs, targeting a given optimization goal. This is achieved by deep reinforcement learning with the help of specially designed neural network structures and various optimizations to stabilize and accelerate the learning. Our results show that RLScheduler can outperform existing heuristic scheduling algorithms, including a manually fine-tuned machine learning-based scheduler on the same workload. More importantly, we show that RLScheduler does not blindly over-fit the given workload to achieve such optimization, instead, it learns general rules for scheduling batch jobs which can be further applied to different workloads and systems to achieve similarly optimized performance. We also demonstrate that RLScheduler is capable of adjusting itself along with changing goals and workloads, making it an attractive solution for the future autonomous HPC management.
연구 동기 및 목표
- 사전 도메인 지식 없이 최적의 스케줄링 정책을 학습하는 자율적 HPC 환경 작업 스케줄러를 개발하는 것.
- 기존 히ュ리스틱 알고리즘과 수작업으로 튜닝된 머신러닝 기반 스케줄러를 초월하여 스케줄링 성능을 향상시키는 것.
- 학습된 스케줄링 규칙을 다양한 워크로드와 시스템 구성으로 일반화할 수 있도록 하는 것.
- 변경되는 최적화 목표 및 워크로드 특성에 대응하여 스케줄링 정책을 동적으로 적응시킬 수 있도록 하는 것.
제안 방법
- RLScheduler는 환경 피드백을 통해 시행착오를 반복하면서 학습하는 스케줄러 에이전트를 딥 강화학습을 통해 훈련시킨다.
- 상태-행동 가치 함수를 표현하기 위해 특수 설계된 신경망 아키텍처를 사용하여 학습 안정성을 향상시킨다.
- 강화학습 에이전트의 훈련 과정을 가속화하고 안정화하기 위해 다양한 최적화 기법을 통합한다.
- 주어진 최적화 목표(예: 작업 전환 시간 최소화)와 일치하는 보상 신호를 최대화하도록 스케줄러를 훈련시킨다.
- 수작업으로 만든 규칙에 의존하지 않고, 작업 및 시스템 상태를 스케줄링 결정으로 매핑하는 정책을 학습한다.
- 학습된 워크로드를 초월하여 일반화되도록 설계되어 새로운 워크로드와 HPC 환경으로의 전이를 가능하게 한다.
실험 결과
연구 질문
- RQ1딥 강화학습 에이전트는 사전 스케줄링 지식 없이 HPC 환경에서 효과적인 작업 스케줄링 정책을 학습할 수 있는가?
- RQ2RLScheduler는 훈련 워크로드를 초월하여 미리 보지 않은 워크로드에서도 최적화된 성능을 달성하는가?
- RQ3최적화 목표 또는 워크로드가 변화할 때 RLScheduler는 스케줄링 정책을 동적으로 적응시킬 수 있는가?
- RQ4히유리스틱 및 수작업으로 튜닝된 머신러닝 기반 스케줄러와 비교해 RLScheduler의 성능은 어떠한가?
주요 결과
- RLScheduler는 작업 전환 시간과 같은 스케줄링 최적화 목표에서 기존 히유리스틱 스케줄링 알고리즘을 능가한다.
- 동일한 워크로드에서 수작업으로 최적화된 머신러닝 기반 스케줄러를 뛰어넘어 뛰어난 학습 능력을 입증한다.
- 새로운 워크로드와 시스템 구성으로의 일반화가 잘 이루어져, 훈련 데이터에 과적합되는 것이 아니라 이전에 학습한 전이 가능한 스케줄링 규칙을 학습한 것으로 나타난다.
- 최적화 목표 또는 워크로드 특성이 변화할 때 RLScheduler는 스케줄링 정책을 동적으로 적응시킬 수 있다.
- 특수 설계된 신경망 구조와 훈련 최적화 기법의 사용으로 안정적이고 효율적인 스케줄링 정책 학습이 가능해졌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.