Skip to main content
QUICK REVIEW

[논문 리뷰] Online Job Scheduling in Distributed Machine Learning Clusters

Yixin Bao, Yanghua Peng|arXiv (Cornell University)|2018. 01. 03.
Cloud Computing and Resource Management참고 문헌 19인용 수 13
한 줄 요약

이 논문은 분산 기계학습 클러스터를 위한 온라인 작업 스케줄링 알고리즘인 OASiS를 제안한다. OASiS는 학습 중에 워커와 파라미터 서버의 수를 동적으로 조정하여 장기적인 작업 유틸리티를 최대화한다. 효율적인 이중 하위알고리즘을 사용하는 원시-이중 프레임워크를 통해 OASiS는 다항 시간 복잡도를 확보하고 시뮬레이션 및 실험 환경에서 표준 스케줄러를 능가하며, 자원 활용도와 완료 시간 성능이 뛰어나다.

ABSTRACT

Nowadays large-scale distributed machine learning systems have been deployed to support various analytics and intelligence services in IT firms. To train a large dataset and derive the prediction/inference model, e.g., a deep neural network, multiple workers are run in parallel to train partitions of the input dataset, and update shared model parameters. In a shared cluster handling multiple training jobs, a fundamental issue is how to efficiently schedule jobs and set the number of concurrent workers to run for each job, such that server resources are maximally utilized and model training can be completed in time. Targeting a distributed machine learning system using the parameter server framework, we design an online algorithm for scheduling the arriving jobs and deciding the adjusted numbers of concurrent workers and parameter servers for each job over its course, to maximize overall utility of all jobs, contingent on their completion times. Our online algorithm design utilizes a primal-dual framework coupled with efficient dual subroutines, achieving good long-term performance guarantees with polynomial time complexity. Practical effectiveness of the online algorithm is evaluated using trace-driven simulation and testbed experiments, which demonstrate its outperformance as compared to commonly adopted scheduling algorithms in today's cloud systems.

연구 동기 및 목표

  • 정적 워커 및 파라미터 서버 할당이 학습 속도를 제한하는 공유 ML 클러스터에서 자원 활용도가 떨어지는 문제를 해결하기 위해.
  • 작업 실행 중에 자원 할당을 적응적으로 조정하여 학습 효율성과 클러스터 전체 유틸리티를 향상시키는 온라인 스케줄링 알고리즘을 설계하기 위해.
  • 장기적인 성능 최적화를 보장하기 위해 작업 유틸리티와 자원 비용을 기반으로 동적 입국 결정을 가능하게 하기 위해.
  • Kubernetes 기반 MXNet 프로토타입에서 트레이스 기반 시뮬레이션과 실제 실험을 통해 알고리즘의 효과성을 평가하기 위해.

제안 방법

  • OASiS는 실시간 스케줄링 결정을 계산하기 위해 원시-이중 최적화 프레임워크를 사용하며, 작업 유틸리티와 자원 비용을 균형 잡는다.
  • 알고리즘은 향후 자원 가용성과 작업 유틸리티를 기반으로 각 작업에 대해 동시 워커 및 파라미터 서버 수를 동적으로 조정한다.
  • 다항 시간 복잡도로 온라인 최적화 문제를 효율적으로 해결하기 위해 이중 하위알고리즘을 사용한다.
  • 자원 가격을 신호로 사용하여 자원이 부족할 경우 유틸리티가 낮은 작업을 걸러내는 데 도움을 준다.
  • Kubernetes와 통합되어 워커 및 파라미터 서버 수의 런타임 재구성 기능을 MXNet에 구현한다.
  • 작업 유틸리티는 완료 시간의 함수로 모델링되며, 우선순위가 높은 작업은 더 우수한 스케줄링 대우를 받는다.

실험 결과

연구 질문

  • RQ1동적인 자원 가용성에 대응하면서 장기적인 유틸리티를 최대화하는 분산 기계학습 클러스터에서의 온라인 작업 스케줄링을 어떻게 최적화할 수 있는가?
  • RQ2실제 기계학습 워크로드에서 고정 할당 대비 동적 워커 및 파라미터 서버 스케일링의 성능 향상은 얼마나 되는가?
  • RQ3OASiS 알고리즘이 FIFO, DRF, RRH와 같은 표준 스케줄러와 비교할 때 작업 유틸리티 및 완료 시점 적시성 측면에서 어떤 성능을 보이는가?
  • RQ4작업 유틸리티-자원 비율의 추정 오차가 알고리즘의 경쟁 비율과 성능에 어떤 영향을 미치는가?

주요 결과

  • OASiS는 오프라인 최적 솔루션 대비 1.1에서 1.5의 성능 비율을 확보하여 현실 조건에서 강력한 경쟁 성능을 입증한다.
  • 자원이 제한된 환경에서 유틸리티-자원 비율을 과소평가할 경우 과대평가하는 것보다 총 유틸리티가 더 높아지며, 이는 작업 필터링 감소로 인한 결과이다.
  • 12개의 작업과 10개의 타임슬롯을 대상으로 한 실험 환경에서 OASiS는 FIFO, DRF, RRH 스케줄러보다 뛰어난 총 작업 유틸리티와 더 나은 완료 적시성을 보였다.
  • 100개의 타임슬롯과 80台의 서버에서 OASiS는 1초 이내에 실행되어 복잡한 최적화 문제에도 불구하고 실용적인 확장성을 입증했다.
  • 시뮬레이션 결과는 OASiS가 불확실한 작업 유틸리티 추정 조건에서도 다항 시간 복잡도를 유지하며 양호한 장기 성능 보장을 확보함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.