[논문 리뷰] CASSINI: Network-Aware Job Scheduling in Machine Learning Clusters
Cassini는 기계학습 클러스터를 위한 네트워크 인지형 작업 스케줄러로, 기하학적 추상화와 친화도 그래프를 사용하여 공유 네트워크 링크를 통해 공동 배치된 작업들의 통신 단계를 겹치게 하여 혼잡을 줄이고 학습 효율을 향상시킵니다. 혼잡 제어나 네트워크 인fra 구조 변경 없이도 꼬리 완료 시간을 최대 2.5배 향상시키고, ECN 마킹된 패킷 수를 최대 33배 감소시킵니다.
We present CASSINI, a network-aware job scheduler for machine learning (ML) clusters. CASSINI introduces a novel geometric abstraction to consider the communication pattern of different jobs while placing them on network links. To do so, CASSINI uses an affinity graph that finds a series of time-shift values to adjust the communication phases of a subset of jobs, such that the communication patterns of jobs sharing the same network link are interleaved with each other. Experiments with 13 common ML models on a 24-server testbed demonstrate that compared to the state-of-the-art ML schedulers, CASSINI improves the average and tail completion time of jobs by up to 1.6x and 2.5x, respectively. Moreover, we show that CASSINI reduces the number of ECN marked packets in the cluster by up to 33x.
연구 동기 및 목표
- 딥러닝 워크로드에서 모델 및 데이터 크기가 증가함에 따라 발생하는 GPU 클러스터 내 증가하는 네트워크 혼잡 문제를 해결한다.
- 기존 기계학습 스케줄러들이 네트워크 링크에 작업을 할당할 때 통신 패턴을 忽略하는 한계를 극복한다.
- 공유 네트워크 링크에 여러 기계학습 작업을 효율적으로 공재할 수 있도록, 그들의 통신 단계 간 간섭을 최소화한다.
- 기존 스케줄러(예: Themis 및 Pollux)와 호환되며 네트워크 하드웨어나 혼잡 제어 프rotocol 변경 없이도 작동하는 확장 가능한, 플러그인 방식의 스케줄러 확장 기능을 설계한다.
- 평균 및 꼬리 작업 완료 시간에서 뚜렷한 성능 향상을 이끌어내며, ECN 마킹 패킷 수와 같은 네트워크 혼잡 지표도 감소시킨다.
제안 방법
- 각 작업의 주기적 통신 패턴을 원으로 모델링하는 기하학적 추상화를 도입하며, 시간은 훈련 반복 시간 비례로 원의 둘레에 감싸여 있다.
- 이 원들의 회전을 통해 동일한 네트워크 링크를 공유하는 작업들 간의 통신 단계 겹침을 최대화하는 최적의 시간 이동값을 찾는다.
- 최적의 시간 이동 후 통신 단계의 겹침 정도에 기반해 작업 간 호환성 점수를 정의함으로써, 간섭을 최소화하는 스케줄링 결정을 지원한다.
- 노드가 작업과 네트워크 링크를 나타내며, 간선이 작업-링크 이동을 나타내는 이분 그래프인 친화도 그래프를 구성함으로써 클러스터 수준의 스케줄링 조율를 가능하게 한다.
- 모든 공유 링크에서 동시에 호환성을 유지하는 모든 작업에 대해 고유한 시간 이동값을 계산하는 새로운 그래프 순회 알고리즘을 개발한다.
- Themis 및 Pollux와 같은 기존 스케줄러에 Cassini를 경량 모듈(~1000줄의 코드)로 통합하여, 기존 스케줄링 로직을 유지하면서도 네트워크 인지형 배치 결정 기능을 추가한다.

실험 결과
연구 질문
- RQ1기하학적 추상화가 공유 네트워크 링크를 통해 여러 기계학습 작업의 통신 단계 겹침을 효과적으로 모델링하고 최적화할 수 있는가?
- RQ2네트워크 경쟁을 최소화하는 데 도움이 되는 작업 배치 결정을 위한 호환성 메트릭은 어떻게 정의하고 계산할 수 있는가?
- RQ3제안된 방법이 혼잡 제어나 네트워크 인fra 변경 없이도 꼬리 완료 시간과 ECN 마킹 패킷 수를 줄일 수 있는가?
- RQ4이 방법은 데이터, 모델, 파이프라인 병렬화와 같은 다양한 병렬화 전략과 다양한 DNN 아키텍처에 얼마나 일반화되는가?
- RQ5기존 스케줄러에 Cassini를 통합할 경우 실제 클러스터 워크로드에서 종단 간 학습 성능에 어떤 영향을 미치는가?
주요 결과
- 24대 서버 테스트베드에서 Cassini는 Pollux 대비 최대 2.5배, Themis 대비 최대 2.2배 꼬리 완료 시간을 향상시켰다.
- 최신 기술 스케줄러 대비 평균 작업 완료 시간이 최대 1.6배 향상되었다.
- 클러스터 내 ECN 마킹 패킷 수가 최대 33배 감소하여 네트워크 혼잡 감소가 뚜렷하게 나타났다.
- 기하학적 추상화와 호환성 점수 기반 메커니즘이 GPU를 공유하지 않는 작업들 간에도 통신 단계 겹침을 성공적으로 가능하게 하여, Muri와 같은 이전 연구의 한계를 극복했다.
- 이 방법은 기존의 통신 최적화 기법들과 수직적(orthogonal)이며, 혼잡 제어나 네트워크 하드웨어 변경 없이도 기존 스케줄러와 통합 가능하다.
- VGG, ResNet, BERT, GPT-1/2/3, DLRM 등 다양한 DNN 모델에 대해 일반화 가능함을 입증하여 일반적인 기계학습 워크로드에 넓은 적용 가능성을 보였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.