Skip to main content
QUICK REVIEW

[논문 리뷰] Communication Scheduling as a First-Class Citizen in Distributed Machine Learning Systems.

Sayed Hadi Hashemi, Sangeetha Abdu Jyothi|arXiv (Cornell University)|2018. 03. 08.
Advanced Graph Neural Networks인용 수 5
한 줄 요약

이 논문은 모델 또는 개발자 입력 변경 없이 그래프 기반 모델에서 통신과 계산의 거의 최적의 겹침을 달성하는 분산 기계학습을 위한 통신 스케줄링 시스템을 제안한다. Tensorflow 기반으로 구축되어, 훈련 처리량을 최대 20% 향상시키고 추론 처리량을 최대 82% 향상시키며, 느린 작업자(straggler) 문제를 최대 2.8배 감소시킨다.

ABSTRACT

State-of-the-art machine learning systems rely on graph-based models, with the distributed training of these models being the norm in AI-powered production pipelines. The performance of these communication-heavy systems depends on the effective overlap of communication and computation. While the overlap challenge has been addressed in systems with simpler model representations, it remains an open problem in graph-based models. In this work, we develop a system for communication scheduling which realizes near-optimal overlap of communication and computation in graph-based models. Our system is implemented over TensorFlow and requires no changes in the model or developer inputs. Our system improves the throughput by up to 82% in inference and 20% in training, while also reducing straggler effect by up to 2.8x. A part of our implementation is already merged with TensorFlow codebase; the rest is publicly available.

연구 동기 및 목표

  • 그래프 기반 기계학습 모델의 분산 훈련에서 효과적인 통신-계산 겹침을 해결하는 데 목적이 있다.
  • 복잡한 모델 표현을 사용하는 시스템에서 통신과 계산의 거의 최적의 겹침을 가능하게 하는 데 목적이 있다.
  • 모델 또는 개발자 입력 변경 없이 기존 프레임워크(예: TensorFlow)에 원활하게 통합될 수 있는 솔루션을 설계하는 데 목적이 있다.
  • 분산 훈련에서 느린 작업자 효과를 줄여 시스템 효율성과 자원 활용도를 향상시키는 데 목적이 있다.

제안 방법

  • 시스템은 분산 기계학습 시스템에서 통신 스케줄링을 일등 시민(abstraction)으로 도입하여, 통신 패턴을 최적화를 위한 일등 시민 엔티티로 간주한다.
  • 계산 그래프를 정적 분석하여 통신 및 계산 의존성을 식별함으로써 정밀한 스케줄링 결정을 가능하게 한다.
  • 데이터 가용성과 자원 제약 조건에 기반해 작업 순서를 재정렬함으로써 스케줄러가 동적으로 통신과 계산을 겹친다.
  • 기존 Tensorflow 인프라를 활용하여 모델 정의나 훈련 코드에 대한 수정이 필요하지 않다.
  • 무료 계산 시간을 최소화하기 위해 통신 작업을 우선순위로 정렬하는 새로운 스케줄링 알고리즘을 사용한다.
  • 그래프 수준에서 스케줄링 논리를 삽입할 수 있도록 Tensorflow의 실행 엔진과 통합되어 투명한 배포를 보장한다.

실험 결과

연구 질문

  • RQ1그래프 기반 기계학습 모델에서 통신과 계산을 효과적으로 겹치기 위해 어떻게 해야 하는가? 이는 시스템 처리량 향상에 기여한다.
  • RQ2모델 코드나 개발 워크플로우를 변경하지 않고도 거의 최적의 겹침을 가능하게 하는 스케줄링 전략은 무엇인가?
  • RQ3통신 스케줄링은 분산 훈련에서 느린 작업자 효과를 어느 정도 감소시킬 수 있는가?
  • RQ4이러한 접근 방식은 다양한 모델 아키텍처와 클러스터 구성에서 어떻게 스케일링되는가?
  • RQ5이러한 방법을 사용할 경우 훈련 및 추론 워크로드에서 어떤 성능 향상이 달성될 수 있는가?

주요 결과

  • 기존 시스템 대비 추론 처리량이 최대 82% 향상된다.
  • 더 나은 통신-계산 겹침 덕분에 훈련 처리량이 최대 20% 향상된다.
  • 느린 작업자 효과가 최대 2.8배 감소하여 부하 균형 조절과 자원 활용도 향상이 확인된다.
  • 구현의 일부가 공식 Tensorflow 코드베이스에 통합되어 실제 생산 환경에서의 준비성이 확인되었다.
  • 모델 정의나 개발자 입력 변경 없이도 통합이 가능하여 채택이 용이하다.
  • 다양한 그래프 기반 모델 아키텍처와 분산 훈련 시나리오에서 효과적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.