Skip to main content
QUICK REVIEW

[논문 리뷰] NetReduce: RDMA-Compatible In-Network Reduction for Distributed DNN Training Acceleration

Shuo Liu, Qiaoling Wang|arXiv (Cornell University)|2020. 09. 21.
Advanced Memory and Neural Computing참고 문헌 32인용 수 13
한 줄 요약

NetReduce는 상용 하드웨어를 수정하지 않으면서도 스위치에 기울여진 기울기 집계를 가능하게 하는 RDMA 호환성의 네트워크 내 감소 아키텍처이다. 이는 엔드 호스트 간에 신뢰할 수 있는 RoCE v2 연결을 유지하면서 분산 DNN 훈련을 가속화한다. FPGA 기반의 네트워크 내 집계와 메시지 수준의 신용 기반 흐름 제어, 최소한의 하드웨어 수정을 통해 CNN 기반 컴퓨터 비전 및 트랜스포머 기반 자연어 처리 워크로드에서 각각 최대 1.7배 및 1.5배의 속도 향상을 달성한다.

ABSTRACT

We present NetReduce, a novel RDMA-compatible in-network reduction architecture to accelerate distributed DNN training. Compared to existing designs, NetReduce maintains a reliable connection between end-hosts in the Ethernet and does not terminate the connection in the network. The advantage of doing so is that we can fully reuse the designs of congestion control and reliability in RoCE. In the meanwhile, we do not need to implement a high-cost network protocol processing stack in the switch, as IB does. The prototype implemented by using FPGA is an out-of-box solution without modifying commodity devices such as NICs or switches. For the coordination between the end-host and the switch, NetReduce customizes the transport protocol only on the first packet in a data message to comply with RoCE v2. The special status monitoring module is designed to reuse the reliability mechanism of RoCE v2 for dealing with packet loss. A message-level credit-based flow control algorithm is also proposed to fully utilize bandwidth and avoid buffer overflow. We study the effects of intra bandwidth on the training performance in multi-machines multi-GPUs scenario and give sufficient conditions for hierarchical NetReduce to outperform other algorithms. We also extend the design from rack-level aggregation to more general spine-leaf topology in the data center. NetReduce accelerates the training up to 1.7x and 1.5x for CNN-based CV and transformer-based NLP tasks, respectively. Simulations on large-scale systems indicate the superior scalability of NetReduce to the state-of-the-art ring all-reduce.

연구 동기 및 목표

  • 기본적인 하드웨어를 수정하지 않고도 기존의 이더넷 네트워크에 효율적인 네트워크 내 집계를 통합하여 분산 DNN 훈련의 통신 병목 현상을 해결하는 것.
  • InfiniBand가 요구하는 고비용 프로토콜 스택이 필요로 하지 않는 스위치에서의 고급 프로토콜 스택 없이도 RoCE v2를 사용하여 신뢰할 수 있는 엔드 투 엔드 연결을 유지하는 것.
  • 엔드 투 엔드 지연 시간과 버퍼 오버플로우 위험을 최소화하여 대규모 다중 머신, 다중 GPU 훈련 환경에서의 확장성과 처리량을 향상시키는 것.
  • 기존 RoCE v2의 혼잡 제어 및 신뢰성 메커니즘을 완전히 재사용하는 FPGA 기반 실용적이고 즉시 사용 가능한 솔루션을 설계하는 것.
  • 다양한 대역폭과 텐서 크기 조건에서 스파ines-리프 데이터센터 토폴로지에서 계층적 NetReduce의 성능 및 확장성 평가

제안 방법

  • NetReduce는 스위치에서 전송 계층을 종료하지 않음으로써 엔드 투 엔드 RoCE v2 연결을 유지하여 기존 혼잡 제어 및 신뢰성 메커니즘의 재사용을 가능하게 한다.
  • 프로토콜 수정을 최소화하기 위해 각 메시지의 첫 번째 패킷만 특수한 전송 프로토콜 헤더로 맞춤 설정하여 RoCE v2 규격을 준수한다.
  • 전용 상태 모니터링 모듈이 RoCE v2의 신뢰성 메커니즘을 재사용하여 패킷 손실을 감지하고 복구하며, 복잡한 네트워크 스택 논리를 추가하지 않는다.
  • 버퍼 오버플로우를 방지하고 고대역폭 네트워크에서 링크 활용도를 극대화하기 위해 메시지 수준의 신용 기반 흐름 제어 알고리즘을 도입한다.
  • 큰 린(링)을 더 작은 마이크로 린(내부 머신 내 린)으로 나누어 계층적 집계를 지원함으로써 엔드 투 엔드 지연 시간을 감소시키고 확장성을 향상시킨다.
  • 프로토타입은 FPGA에 구현되어 있어 기존의 상용 NIC나 스위치를 수정하지 않고도 네트워크 내 감소를 가능하게 하여 호환성과 배포 용이성을 확보한다.

실험 결과

연구 질문

  • RQ1RoCE v2와 같은 RDMA 호환 프로토콜을 사용하여 특수 하드웨어나 스위치의 프로토콜 스택 변경 없이 존재하는 이더넷 네트워크에 네트워크 내 집계를 효율적으로 통합할 수 있는가?
  • RQ2다양한 텐서 크기와 GPU 수 조건에서 계층적 네트워크 내 감소가 평탄한 린(all-reduce)에 비해 확장성과 성능 면에서 어떻게 비교되는가?
  • RQ3대규모 다중 머신, 다중 GPU 훈련 환경에서 계층적 NetReduce가 평탄한 린 all-reduce를 능가하는 데 필요한 충분한 조건은 무엇인가?
  • RQ4SwitchML이나 SHARP와 같은 기존 솔루션 대비 FPGA 기반 네트워크 내 집계가 엔드 투 엔드 처리량을 얼마나 향상시키는가?
  • RQ5고정점 산술을 사용하여 기울기 집계를 수행할 경우 NetReduce는 훈련 수렴성과 모델 정확도를 유지하는가?

주요 결과

  • CNN 기반 컴퓨터 비전 작업에서는 기준 all-reduce 방법 대비 최대 1.7배의 속도 향상을, 트랜스포머 기반 자연어 처리 작업에서는 최대 1.5배의 속도 향상을 달성한다.
  • 네트워크 내 감소에 고정점 산술을 사용하더라도 훈련 수렴성이 유지되어 모델 정확도에 큰 영향을 주지 않는 것으로 나타났다.
  • 내부 머신 대역폭(B_intra)이 충분히 높을 경우 계층적 NetReduce는 평탄한 린 all-reduce를 능가하며, 최적 성능을 내기 위한 임계 비율은 B_intra/B_inter ≥ 2.3이다.
  • 시뮬레이션 결과, NetReduce의 통신 비용은 GPU 수(P)에 영향을 받지 않지만, 평탄한 린 all-reduce는 2(P-1) 전송 요소로 인해 P에 따라 선형적으로 지연 시간이 증가한다.
  • B_intra = 150 GB/s(NVLink), B_inter = 12.5 GB/s(100GbE) 조건에서 NetReduce의 B_intra/B_inter 비율은 12로 2.3의 임계값을 훨씬 초과하여 다양한 텐서 크기에서 일관된 성능 향상을 달성한다.
  • 엔드 투 엔드 지연 시간 감소와 안정적인 흐름 제어 덕분에 대규모 시뮬레이션에서 특히 고지연 또는 고GPU 환경에서 뛰어난 확장성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.