Skip to main content
QUICK REVIEW

[논문 리뷰] TACCL: Guiding Collective Algorithm Synthesis using Communication Sketches

Aashaka Shah, Vijay Chidambaram|arXiv (Cornell University)|2021. 11. 08.
Ferroelectric and Negative Capacitance Devices인용 수 6
한 줄 요약

TACCL은 인간이 제공한 통신 스케치를 활용하여 효율적인 GPU 집합 통신 알고리즘의 자동 합성 과정을 안내하는 새로운 도구로, 검색 공간을 크게 줄이고 다중 노드 GPU 환경에서 확장 가능하고 고성능의 알고리즘 생성을 가능하게 한다. TACCL은 NCCL 대비 최대 6.7배 빠르며, BERT 및 Transformer-XL 학습을 11%~2.3배 빠르게 한다.

ABSTRACT

Machine learning models are increasingly being trained across multiple GPUs and servers. In this setting, data is transferred between GPUs using communication collectives such as AlltoAll and AllReduce, which can become a significant bottleneck in training large models. Thus, it is important to use efficient algorithms for collective communication. We develop TACCL, a tool that enables algorithm designers to guide a synthesizer into automatically generating algorithms for a given hardware configuration and communication collective. TACCL uses a novel communication sketch abstraction to get crucial information from the designer to significantly reduce the search space and guide the synthesizer towards better algorithms. TACCL also uses a novel encoding of the problem that allows it to scale beyond single-node topologies. We use TACCL to synthesize algorithms for three collectives and two hardware topologies: DGX-2 and NDv2. We demonstrate that the algorithms synthesized by TACCL outperform the Nvidia Collective Communication Library (NCCL) by up to 6.7x. We also show that TACCL can speed up end-to-end training of Transformer-XL and BERT models by 11%--2.3x for different batch sizes.

연구 동기 및 목표

  • 혼합 대역폭과 지연 특성을 가진 대규모 이질적 GPU 환경에서 효율적인 집합 통신 알고리즘 설계의 과제를 해결한다.
  • 다중 노드 시스템에서 집합 알고리즘의 라우팅 및 스케줄링 옵션 전역 검색 공간을 탐색하는 데 있어 계산적으로 비현실적인 문제를 해결한다.
  • 새로운 추상화 방식인 통신 스케치를 통해 알고리즘 설계자의 고수준 직관을 통합함으로써 합성 시간을 단축하고 확장성을 향상시킨다.
  • DGX-2 및 NDv2와 같은 특정 하드웨어 구성에 맞게 최적화된 Allreduce, Allgather, Alltoall 알고리즘의 자동 생성을 가능하게 한다.
  • 스케치 기반 검색과 이완된 MILP 공식화 및 히우리스틱 최적화 기법을 융합하여 기존 라이브러리인 NCCL보다 뛰어난 성능을 달성한다.

제안 방법

  • 프로그램 스케치에서 영감을 얻은 고수준 추상화인 통신 스케치를 도입하여, 알고리즘 설계자가 집합 통신의 데이터 라우팅 및 스케줄링에 대한 구조적 직관을 표현할 수 있도록 한다.
  • 확장성을 향상시키기 위해 라우팅을 이완하고 연속 시간 스케줄링을 사용하는 혼합정수선형계획문제(MILP)로 집합 통신 합성 문제를 공식화한다.
  • 세 단계 합성 파이프라인을 적용한다: 타당한 경로 탐색을 위한 이완된 라우팅, 고대역폭 링크 우선순위를 고려한 히우리스틱 순서 정렬, 연속성 제약 조건을 포함한 정확한 스케줄링으로 공백 시간을 최소화한다.
  • 대칭성과 토폴로지 인식 인코딩을 활용하여 상태 공간을 줄여, 2D 토러스 및 계층적 클러스터(예: DGX-2, Azure NDv2)와 같은 복잡한 토폴로지에서도 합성을 가능하게 한다.
  • 프로파일링된 네트워크 토폴로지 및 입력 크기 정보를 입력으로 사용하여 하드웨어 인식, 지연 및 대역폭 최적화된 알고리즘으로 유도한다.
  • 하위 시스템을 통해 합성된 알고리즘을 저수준 GPU 통신 프리미티브로 매핑하여 기존 분산 딥러닝 프레임워크와의 호환성을 보장한다.

실험 결과

연구 질문

  • RQ1통신 스케치는 대규모 GPU 토폴로지에서 검색 공간을 줄이며 집합 통신 알고리즘의 자동 합성을 효과적으로 이끌 수 있는가?
  • RQ2다양한 링크 속도를 가진 이질적 네트워크 토폴로지에서 단일 노드 시스템을 초월해 효율적인 집합 알고리즘의 합성을 어떻게 확장할 수 있는가?
  • RQ3직관적인 스케치를 활용한 인간-중심 접근 방식이 순수 자동화 또는 히우리스틱 기반 방법보다 고성능 통신 알고리즘 생성에서 뛰어난 성능을 내는가?
  • RQ4이완된 MILP 공식화와 히우리스틱 최적화 기법을 융합한 제안된 공식화는 대규모 GPU 클러스터에서 여전히 타당하면서도 근사 최적 성능을 달성할 수 있는가?
  • RQ5다양한 워크로드와 하드웨어 구성에서 실제 성능 측정 결과로, 합성된 알고리즘은 NCCL과 같은 최신 라이브러리와 비교해 어떻게 성능을 냈는가?

주요 결과

  • TACCL은 8개의 Azure NDv2 노드(64개 GPU)에 대해 Allgather 알고리즘을 5분 이내로 합성하여 다양한 데이터 크기에서 NCCL 대비 최대 1.7배 높은 알고리즘 대역폭을 달성했다.
  • 8개의 DGX-2 노드(128개 GPU)에 대해 TACCL은 약 11시간 만에 유효한 Allgather 알고리즘을 생성하여 대규모 다중 노드 시스템으로의 확장성을 입증했다.
  • 테스트된 집합 연산과 토폴로지에서 TACCL은 NCCL 대비 종단 간 통신 성능을 최대 6.7배 향상시켰다.
  • 버치 사이즈에 따라 달라지는 통신 병목 현상을 줄여 BERT 및 Transformer-XL 모델의 종단 간 학습 속도가 11%에서 2.3배 빨라졌다.
  • TACCL은 대칭성을 활용하여 2D $6\times8$ 토러스와 같은 비계층적 토폴로지에 대해 효율적인 알고리즘을 성공적으로 생성했다.
  • 통신 스케치의 사용은 다양한 입력 크기 범위에 최적화된 알고리즘 변형을 탐색할 수 있도록 하여 개발자의 설계 직관을 반영했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.