Skip to main content
QUICK REVIEW

[논문 리뷰] TopoOpt: Co-optimizing Network Topology and Parallelization Strategy for Distributed Training Jobs

Weiyang Wang, Moein Khazraee|arXiv (Cornell University)|2022. 02. 01.
Ferroelectric and Negative Capacitance Devices인용 수 16
한 줄 요약

TopoOpt는 재구성 가능한 광학 패브릭을 사용하여 분산 DNN 학습을 위한 네트워크 토폴로지와 병렬화 전략을 공동 최적화함으로써, 워크로드 수요에 맞는 동적이고 효율적인 토폴로지를 가능하게 한다. 교대로 최적화하고 군 이론에 영감을 받은 알고리즘인 TotientPerms를 통해 계산, 통신, 토폴로지를 종합적으로 최적화함으로써, 유사 비용의 Fat-tree 네트워크 대비 최대 3.4배 빠른 학습 반복 시간을 달성한다.

ABSTRACT

We propose TopoOpt, a novel direct-connect fabric for deep neural network (DNN) training workloads. TopoOpt co-optimizes the distributed training process across three dimensions: computation, communication, and network topology. We demonstrate the mutability of AllReduce traffic, and leverage this property to construct efficient network topologies for DNN training jobs. TopoOpt then uses an alternating optimization technique and a group theory-inspired algorithm called TotientPerms to find the best network topology and routing plan, together with a parallelization strategy. We build a fully functional 12-node direct-connect prototype with remote direct memory access (RDMA) forwarding at 100 Gbps. Large-scale simulations on real distributed training models show that, compared to similar-cost Fat-Tree interconnects, TopoOpt reduces DNN training time by up to 3.4x.

연구 동기 및 목표

  • 분산 DNN 학습에서 예측 가능하고 반복적인 AllReduce 및 모델 병렬 전송 패턴에 부적합한 Fat-tree 인터커넥트의 증가하는 병목 현상을 해결한다.
  • 실제 DNN 학습 워크로드를 반영하지 않는 전통적인 데이터센터 네트워크의 불확실하고 일시적인 트래픽을 가정하는 한계를 극복한다.
  • 계산, 통신, 네트워크 토폴로지의 세 가지 차원을 공동 최적화하여 각 학습 작업에 최적의 병렬화 전략과 물리적 토폴로지를 함께 선택한다.
  • 재구성 가능한 광학 스위치와 호스트 기반 RDMA 포워딩을 활용해 각 작업별 전용이고 효율적인 토폴로지를 설계함으로써 성능과 비용 효율성을 향상시킨다.
  • 기존 인터커넥트 대비 토폴로지 인식 최적화가 학습 반복 시간과 비용을 크게 줄임을 입증한다.

제안 방법

  • 고정된 토폴로지 하에서 병렬화 전략을 반복적으로 개선한 후, 해당 트래픽 수요에 기반해 토폴로지를 업데이트하는 교대로 최적화 프레임워크를 제안한다.
  • AllReduce에 효율적이면서도 모델 병렬 전송에 적합한 AllReduce 순열을 생성하는 군 이론에 영감을 받은 알고리즘인 TotientPerms를 도입하여 홉 수를 줄이고 로드 밸런싱을 향상시킨다.
  • 재구성 가능한 패치 패널을 갖춘 직접 연결 광학 패브릭을 사용해 각 DNN 학습 작업에 전용이고 저지연의 파artition을 만들며, 동적 토폴로지 재구성을 가능하게 한다.
  • NIC 네트워크 파artitioning(NPAR)을 활용해 호스트 기반 RDMA 포워딩을 구현하여 비국소 트래픽 전달이 가능하게 하면서도 RDMA 의미 체계를 유지함으로써 표준 RDMA의 핵심 한계를 극복한다.
  • TotientPerms를 NCCL에 통합하여 다중 루프-AllReduce 하위 토폴로지 간에 균형 잡힌 파라미터 동기화를 가능하게 한다.
  • 12개 노드의 프로토타입을 구축하여 100 Gbps RDMA NIC와 Telescent 광학 패치 패널을 사용해 실세계 조건에서 시스템을 검증한다.

실험 결과

연구 질문

  • RQ1기존의 Fat-tree 인터커넥트에 비해 네트워크 토폴로지와 병렬화 전략을 공동 최적화함으로써 DNN 학습 시간을 크게 줄일 수 있는가?
  • RQ2AllReduce 트래픽의 재구성 가능성을 어떻게 활용하여 AllReduce와 모델 병렬 통신을 동시에 최적화하는 토폴로지를 설계할 수 있는가?
  • RQ3DNN 학습 작업의 공동 최적화된 계산, 통신, 토폴로지 구성의 큰 검색 공간을 효율적으로 탐색할 수 있는 알고리즘 기법은 무엇인가?
  • RQ4재구성 가능한 광학 인터커넥트가 작업별 트래픽 패턴에 동적으로 적응함으로써 비용 효율적이고 고성능의 DNN 학습을 가능하게 할 수 있는가?
  • RQ5비국소 패킷이 전달되어야 하는 호스트 리레이는 아키텍처에서 RDMA 기반 포워딩을 어떻게 안정적으로 작동시킬 수 있는가?

주요 결과

  • TopoOpt는 비용이 유사한 Fat-tree 인터커넥트 대비 DNN 학습 반복 시간을 최대 3.4배 단축시켜 뚜렷한 성능 향상을 입증한다.
  • 시스템은 이상적인 전체 이분대역폭 Fat-tree보다 평균 3.2배 낮은 비용을 기록하여 뛰어난 비용 효율성을 보였다.
  • DLRM, CANDLE, BERT, NCF, ResNet50, VGG 등 6종의 실제 DNN 모델을 대상으로 한 대규모 시뮬레이션을 통해 다양한 아키텍처에서 일관된 성능 향상을 확인했다.
  • TotientPerms는 AllReduce에 효율적인 순열을 제공할 뿐 아니라 모델 병렬 전송의 홉 수를 줄여 전체 통신 효율성을 향상시킨다.
  • NCCL에 TotientPerms를 통합함으로써 다중 루프-AllReduce 하위 토폴로지 간에 균형 잡힌 파라미터 동기화가 가능해져 확장성이 향상되었다.
  • 100 Gbps RDMA와 광학 재구성 기능을 갖춘 12노드 프로토타입은 실용성과 성능을 실제 환경에서 성공적으로 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.