Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Algorithms for Device Placement of DNN Graph Operators

Jakub Tarnawski, Amar Phanishayee|arXiv (Cornell University)|2020. 06. 29.
Advanced Neural Network Applications참고 문헌 36인용 수 15
한 줄 요약

이 논문은 추론 및 학습 워크로드 모두에서 DNN 연산자에 대한 장치 배치를 위한 최적의 정수계획법 및 동적계획법 알고리즘을 제안하며, 지연 시간 최소화와 처리량 최대화를 목표로 한다. 국소 검색 대비 최대 2.08배, Scotch 대비 최대 7.69배의 성능 향상을 달성했으며, 복잡한 메모리 제약이 있는 DNN 그래프에서 전문가 히ュ리스틱보다 지연 시간 감소율이 최대 72% 높다.

ABSTRACT

Modern machine learning workloads use large models, with complex structures, that are very expensive to execute. The devices that execute complex models are becoming increasingly heterogeneous as we see a flourishing of domain-specific accelerators being offered as hardware accelerators in addition to CPUs. These trends necessitate distributing the workload across multiple devices. Recent work has shown that significant gains can be obtained with model parallelism, i.e, partitioning a neural network's computational graph onto multiple devices. In particular, this form of parallelism assumes a pipeline of devices, which is fed a stream of samples and yields high throughput for training and inference of DNNs. However, for such settings (large models and multiple heterogeneous devices), we require automated algorithms and toolchains that can partition the ML workload across devices. In this paper, we identify and isolate the structured optimization problem at the core of device placement of DNN operators, for both inference and training, especially in modern pipelined settings. We then provide algorithms that solve this problem to optimality. We demonstrate the applicability and efficiency of our approaches using several contemporary DNN computation graphs.

연구 동기 및 목표

  • 이종적이고 메모리 제약이 있는 가속기에서 대규모 복잡한 DNN을 추론 및 학습 워크로드에 배포하는 데 증가하는 도전 과제를 해결하기 위해.
  • 모델 병렬 DNN 실행에서 효율적인 장치 배치의 핵심 조합 최적화 문제를 규명하고 해결하기 위해.
  • 지연 시간에 민감한 단일 스트림 추론과 처리량 최적화된 파이프라인 학습에 대해 증명 가능하게 최적의 해를 제공하기 위해.
  • 다양한 메모리 및 대역폭 제약을 가진 다양한 장치 유형 간에 비연속적인 그래프 분할을 지원하기 위해.
  • строго한 메모리 제약 조건 하에서 해의 품질과 강건성 측면에서 히ュ리스틱, 전문가 및 베이스라인 방법을 모두 능가하기 위해.

제안 방법

  • 단일 스트림 추론에서 지연 시간 최소화를 위해 연산자 분할과 스케줄링을 동시에 최적화하는 정수계획법(IP) 모델로 장치 배치 문제를 수식화한다.
  • 파이프라인 학습에서 처리량 최대화를 위해 동적계획법(DP) 접근법을 개발하며, 데이터플로우와 계산 및 통신의 겹침을 모델링한다.
  • 세분화된 연산자 그래프를 포함한 임의의 DAG를 지원하며, 다양한 가속기 간에 비연속적인 분할도 허용한다.
  • 메모리 및 인터커넥트 제약 조건을 최적화에 직접 통합하여 하드웨어 제약 조건 하에서도 실행 가능한 배치를 보장한다.
  • 해결 품질과 런타임의 균형을 맞추기 위해 최적성 갭 인증 기능을 갖춘 시간 제한 IP 솔버를 사용한다.
  • 학습(모델 병렬 및 파이프라인 병렬)과 추론(단일 스트림 및 오프라인) 시나리오 모두에 적용 가능한 통합 프레임워크를 구현한다.

실험 결과

연구 질문

  • RQ1DNN 실행에서 종단 간 장치 배치 및 스케줄링 간 상호 작용을 포괄하는 올바른 조합 최적화 문제는 무엇인가?
  • RQ2메모리 및 통신 제약 조건 하에서 추론 및 학습 모두에서 DNN에 대해 증명 가능하게 최적의 장치 배치를 달성하는 방법은 무엇인가?
  • RQ3비연속적인 그래프 분할이 연속적이거나 히ュ리스틱적 분할에 비해 성능 향상에 얼마나 기여하는가?
  • RQ4제안된 방법은 지연 시간과 처리량 측면에서 전문가가 설계한, 근사 알고리즘, 최신 기술 기반의 베이스라인과 비교해 어떻게 성능을 냈는가?
  • RQ5최대 수십억 개의 파라미터와 복잡한 연산자 그래프를 가진 실제 DNN에 대해 최적화 프레임워크는 확장 가능한가?

주요 결과

  • IP 기반 알고리즘은 근사 알고리즘 대비 최대 72% 낮은 지연 시간을 기록했으며, 최대 부하 DP 대비 42% 낮은 지연 시간을 기록하여 지연 시간 최소화에서 뛰어난 성능을 입증했다.
  • 가장 성능이 뛰어난 워크로드에서 IP 솔버는 국소 검색 대비 2.08배, Scotch 대비 7.69배의 지연 시간 감소를 달성했으며, Scotch는 34%의 경우에서 메모리 제약을 위반했다.
  • 8개 워크로드 중 5개에서 IP 솔버는 1시간 이내에 최적해에 수렴하지 못했지만, 모든 베이스라인보다 우수한 해를 찾았으며, 이는 실용적 성능이 뛰어나다는 것을 시사한다.
  • 모든 워크로드에서 IP 솔버는 7분 이내에 최종 값의 2% 이내의 해를 확보했으며, 이는 고품질 결과를 위한 조기 종료가 가능함을 시사한다.
  • 인간 전문가가 설정한 분할은 지연 시간 측면에서 최대 23% 떨어졌으며, 두 경우에서는 메모리 제약을 3배 이상 위반했다. 이는 수동 튜닝의 한계를 보여준다.
  • 이 방법은 전문가 분할 대비 평균 1.46배 빠르고, 국소 검색 대비 1.29배 빠르며, 비연속 분할이 항상 모든 대안보다 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.