Skip to main content
QUICK REVIEW

[논문 리뷰] Synthesizing Optimal Parallelism Placement and Reduction Strategies on Hierarchical Systems for Deep Learning

Ningning Xie, Tamara Norman|arXiv (Cornell University)|2021. 10. 20.
Parallel Computing and Optimization Techniques참고 문헌 11인용 수 7
한 줄 요약

이 논문은 다수의 GPU 계층 구조에서 딥러닝을 위한 최적의 병렬 처리 배치와 계층 인식 감소 전략을 합성하는 프레임워크 $P^{2}$를 제안한다. 병렬 처리를 구조적 행렬로 모델링하고, 형식적 의미론을 기반으로 한 문법 유도 프로그램 합성 기법을 사용하여 통신 오버헤드를 줄인다. 이로 인해 전체 감소(all-reduce) 성능이 최대 448× 향상되고, 69%의 경우에서 기본 구현 대비 2.04×의 성능 향상을 달성한다. 또한 시뮬레이터를 통해 상위 10개 성능 전략을 92%의 정확도로 예측한다.

ABSTRACT

We present a novel characterization of the mapping of multiple parallelism forms (e.g. data and model parallelism) onto hierarchical accelerator systems that is hierarchy-aware and greatly reduces the space of software-to-hardware mapping. We experimentally verify the substantial effect of these mappings on all-reduce performance (up to 448x). We offer a novel syntax-guided program synthesis framework that is able to decompose reductions over one or more parallelism axes to sequences of collectives in a hierarchy- and mapping-aware way. For 69% of parallelism placements and user requested reductions, our framework synthesizes programs that outperform the default all-reduce implementation when evaluated on different GPU hierarchies (max 2.04x, average 1.27x). We complement our synthesis tool with a simulator exceeding 90% top-10 accuracy, which therefore reduces the need for massive evaluations of synthesis results to determine a small set of optimal programs and mappings.

연구 동기 및 목표

  • 다양한 병렬 처리 형태(예: 데이터 병렬, 모델 병렬)가 계층적 하드웨어에 비효율적으로 매핑되면서 발생하는 높은 통신 비용을 해결하기 위해.
  • 매핑의 계층 인식 행렬 기반 표현을 도입하여 효과적인 병렬 처리 배치 및 감소 전략의 검색 공간을 줄이기 위해.
  • 형식적 의미론과 도메인 특화 언어(DSL)를 사용하여 최적화된 집합적 통신 시퀀스를 생성하는 프로그램 합성 프레임워크를 개발하기 위해.
  • 모의 실험을 통해 성능 예측을 정확하게 수행하여 합성된 프로그램의 전체 하드웨어 평가가 필요한 비용을 최소화하기 위해.
  • 다양한 GPU 토폴로지에서 복합적인 병렬 처리 조합을 고려할 때, 표준 전체 감소 구현보다 우수한 성능을 보이는 맞춤형 감소 전략이 성능을 뛰어나게 한다는 것을 입증하기 위해.

제안 방법

  • 병렬 처리 배치를 시스템 계층 수준(rack, server, GPU 등)에 병렬 처리 축(예: 데이터, 모델)을 매핑하는 병렬 처리 행렬로 모델링하여 검색 공간을 극도로 줄인다.
  • 계층적 감소를 표현하기 위해 도메인 특화 언어(DSL)를 도입하고, 정당성 보장을 위해 호어 트리플 기반 형식적 의미론을 사용한다.
  • 형식적 의미론에 따라 유도되는 문법 기반 합성 절차를 통해 AllReduce와 같은 집합적 연산의 시퀀스를 생성하며, 의미론적 타당성을 보장한다.
  • 병렬 처리 행렬을 활용하여 가능한 감소 전략의 검색 공간을 정제하여, 유효한 프로그램이 누락되지 않으면서도 효율성을 향상시킨다.
  • 실제 대역폭 가정을 기반으로 네트워크 계층(NIC, PCIe, NVLink) 간의 통신 비용을 모델링하는 시뮬레이터를 포함하여 성능을 예측한다.
  • XLA 및 NCCL와 통합된 합성 파이프라인을 통해 표준 딥러닝 워크로드를 사용하여 실제 시스템에서 평가할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1표현력이나 완전성 손실 없이 계층적 시스템에서 병렬 처리 배치의 검색 공간을 어떻게 줄일 수 있는가?
  • RQ2다양한 GPU 시스템 토폴로지에서 다양한 병렬 처리 매핑이 전체 감소 성능에 어떤 영향을 미치는가?
  • RQ3형식적 의미론과 DSL 기반 접근법을 통해 고성능의 계층 인식 감소 전략을 합성할 수 있으며, 이는 기본 전체 감소 구현보다 뛰어난 성능을 낼 수 있는가?
  • RQ4모의 실험을 통해 합성된 감소 전략의 성능을 얼마나 정확하게 예측할 수 있으며, 이는 고비용의 하드웨어 평가를 줄일 수 있는가?
  • RQ5병렬 처리 행렬 모델링과 문법 기반 합성의 조합이 딥러닝 워크로드에 최적의 통신 패턴을 식별하는 데 얼마나 효과적인가?

주요 결과

  • 한 개의 AllReduce 연산 성능은 병렬 처리 배치에 따라 최대 448.5×까지 변동되며, 이는 매핑 선택이 통신 효율성에 미치는 결정적 영향을 보여준다.
  • 69%의 병렬 처리 배치에서 합성된 감소 전략이 기본 AllReduce 구현보다 뛰어나며, 최대 2.04×의 성능 향상과 평균 1.27×의 향상을 달성한다.
  • 시뮬레이터는 상위 10개 성능 전략 예측에서 92%의 정확도를 달성하여 전체 하드웨어 평가가 필요한 양을 크게 줄였다.
  • 프레임워크는 복잡한 토폴로지에서도 근사 최적의 프로그램을 성공적으로 식별하였으며, V100 및 A100 GPU 시스템에서의 실험 결과와 예측 결과가 밀도 있게 일치한다.
  • XLA 최적화는 시뮬레이션 정확도에 영향을 줄 수 있으나, $P^{2}$는 최적화된 프로그램(예: 단일 AllReduce 단계로 축소된 프로그램)의 성능을 여전히 정확하게 예측한다.
  • 형식적 의미론과 문법 기반 합성의 사용으로 생성된 모든 프로그램이 의미론적으로 타당하며, 잘못된 결과나 최적 솔루션 누락이 발생하지 않는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.