Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Optimize DAG Scheduling in Heterogeneous Environment

Jinhong Luo, Zhou, Yunfan|arXiv (Cornell University)|2021. 03. 09.
Cloud Computing and Resource Management참고 문헌 18인용 수 5
한 줄 요약

이 논문은 이질적 클러스터에서 작업 의존성을 인식하기 위해 그래프 신경망(GNN)을 사용하고, 이종 환경에서의 작업 중복 및 실행자 할당을 위한 히ュ리스틱 규칙을 적용하는 이단계 강화학습 기반 알고리즘인 LACHESIS을 제안한다. 이는 최상위 기준선 대비 최대 26.7%의 마이크스팬 감소와 35.2%의 스피드업 향상을 달성한다.

ABSTRACT

Scheduling job flows efficiently and rapidly on distributed computing clusters is one of huge challenges for daily operation of data centers. In a practical scenario, a single job consists of numerous stages with complex dependency relation represented as a Directed Acyclic Graph (DAG) structure. Nowadays a data center usually equips with a cluster of heterogeneous computing servers which are different in the hardware/software configuration. From both the cost saving and environmental friendliness, the data centers could benefit a lot from optimizing the job scheduling problems in the heterogeneous environment. Thus the problem has attracted more and more attention from both the industry and academy. In this paper, we propose a task-duplication based learning algorithm, namely \lachesis \footnote{The second of the Three Fates in ancient Greek mythology, who determines destiny.}, aiming to optimize the problem. In the proposed approach, it first perceives the topological dependencies between jobs using a reinforcement learning framework and a specially designed graph neural network (GNN) to select the most promising task to be executed. Then the task is assigned to a specific executor with the consideration of duplicating all its precedent tasks according to an expert-designed rules. We have conducted extensive experiments over standard workloads to evaluate the proposed solution. The experimental results suggest that \lachesisquad can achieve at most 26.7\% reduction of makespan and 35.2\% improvement of speedup ratio over seven strong baseline algorithms, including the state-of-the-art heuristics methods and a variety of deep reinforcement learning based algorithms.

연구 동기 및 목표

  • 다양한 실행자 능력을 지닌 이종 컴퓨팅 환경에서 효율적인 DAG 작업 스케줄링 문제를 해결하기 위해.
  • 작업 중복 및 동적 실행자 할당을 활용하여 마이크스팬을 줄이고 스피드업을 향상시키기 위해.
  • 실시간 데이터센터 워크로드에서 복잡하고 동적인 대규모 작업 의존성에 적응할 수 있는 학습 기반 스케줄링 프레임워크를 설계하기 위해.
  • 배치 및 연속적 작업 도착 시나리오 양쪽 모두에서 기존 히ュ리스틱 및 딥 강화학습 기반 스케줄링 알고리즘을 능가하기 위해.

제안 방법

  • 그래프 신경망(GNN)을 사용하여 DAG 작업의 위상적 구조를 인코딩하고 의존성 관계를 포착한다.
  • 강화학습 정책 네트워크는 GNN 임베딩 상태 표현을 기반으로 다음으로 실행할 작업을 선택한다.
  • 히ュ리스틱 규칙은 선택된 작업에 대해 최적의 실행자를 결정하며, 통신 오버헤드를 줄이기 위해 조상 작업을 중복할지 여부도 결정한다.
  • 작업 중복은 계산 비용과 통신 비용을 균형 잡는 방식으로 전반적인 작업 완료 시간을 최소화하기 위해 전략적으로 적용된다.
  • 프레임워크는 이중 단계 파이프라인으로 구현된다: (1) 강화학습 정책을 통한 작업 선택, (2) 전문가가 설계한 규칙을 활용한 실행자 할당 및 중복 결정.
  • 표준 워크로드와 실제 데이터센터 패턴을 사용하여, 배치 모드와 연속적 작업 도착 모드 양쪽 모두에서 평가가 수행되었다.

실험 결과

연구 질문

  • RQ1강화학습과 GNN를 조합하여 이종 스케줄링 환경에서 복잡한 DAG 의존성을 효과적으로 모델링할 수 있는가?
  • RQ2비중복 기준선 대비 작업 중복이 이종 클러스터에서 마이크스팬과 스피드업에 얼마나 기여하는가?
  • RQ3최신 딥 러닝 및 히ュ리스틱 스케줄링 방법과 비교해 볼 때, 제안된 LACHESIS 알고리즘이 성능과 추론 시간 측면에서 어떻게 성과를 내는가?
  • RQ4학습 기반 접근법은 대규모이고 동적인 워크로드에 확장되면서도 낮은 의사결정 지연을 유지할 수 있는가?

주요 결과

  • LACHESIS는 모든 테스트 시나리오에서 최상의 기준선 알고리즘 대비 최대 26.7%의 마이크스팬 감소를 달성한다.
  • LACHESIS의 스피드업 비율은 두 번째로 우수한 알고리즘 대비 최대 35.2% 높아, 뛰어난 확장성과 효율성을 입증한다.
  • 배치 모드에서는 LACHESIS의 98% 의사결정이 30ms 이내에 완료되어 강력한 실시간 성능를 보인다.
  • 연속 모드에서는 LACHESIS가 두 번째로 우수한 알고리즘 대비 평균 마이크스팬을 최대 7.4% 감소시켜 동적 워크로드에서의 강건성을 입증한다.
  • LACHESIS의 SLR(Speedup Loss Ratio)는 평가된 모든 알고리즘 중에서 가장 낮게 유지되어 높은 스케줄링 품질을 나타낸다.
  • 특히 대규모 및 연속적 작업 도착 환경에서, 효과적인 중복 및 실행자 선택 전략 덕분에 LACHESIS는 딥러닝 모델인 Decima-DEFT조차도 능가한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.