[논문 리뷰] DistGNN: Scalable Distributed Training for Large-Scale Graph Neural Networks.
DistGNN는 공유 메모리 효율성, 최소 정점 컷 그래프 분할, 지연 업데이트 알고리즘을 통해 Deep Graph Library(DGL)를 최적화하여 CPU 클러스터에서 대규모 그래프 신경망(GNN)을 확장 가능한 분산 학습 프레임워크로 제안한다. 단일 소켓 CPU 학습 대비 기준선 DGL 대비 128개 CPU 소켓을 사용할 경우 최대 97배의 속도 향상을 달성한다.
Full-batch training on Graph Neural Networks (GNN) to learn the structure of large graphs is a critical problem that needs to scale to hundreds of compute nodes to be feasible. It is challenging due to large memory capacity and bandwidth requirements on a single compute node and high communication volumes across multiple nodes. In this paper, we present DistGNN that optimizes the well-known Deep Graph Library (DGL) for full-batch training on CPU clusters via an efficient shared memory implementation, communication reduction using a minimum vertex-cut graph partitioning algorithm and communication avoidance using a family of delayed-update algorithms. Our results on four common GNN benchmark datasets: Reddit, OGB-Products, OGB-Papers and Proteins, show up to 3.7x speed-up using a single CPU socket and up to 97x speed-up using 128 CPU sockets, respectively, over baseline DGL implementations running on a single CPU socket
연구 동기 및 목표
- 대규모 그래프에서 분산 CPU 클러스터를 통해 전체 배치 GNN 학습의 확장성 도전 과제를 해결하기 위해.
- 단일 노드에서의 메모리 및 대역폭 병목을 줄이고 분산 환경에서의 노드 간 통신을 최소화하기 위해.
- 공유 메모리 및 통신 인지 기법을 사용하여 CPU 클러스터에서 효율적인 전체 배치 학습을 위한 Deep Graph Library(DGL)를 최적화하기 위해.
- 수백 개의 컴퓨팅 노드로 확장하여 거대한 그래프에서 GNN 학습을 실현 가능하게 하기 위해.
제안 방법
- 개별 노드의 메모리 압박을 줄이기 위해 효율적인 공유 메모리 구현을 적용하기 위해.
- 노드 간 통신량을 최소화하기 위해 최소 정점 컷 그래프 분할 알고리즘을 적용하기 위해.
- 노드 간 부과적인 통신을 방지하기 위해 지연 업데이트 알고리즘의 일련의 기법을 도입하기 위해.
- 통신 감소 및 회피 전략을 통합하여 DGL 프레임워크를 분산 학습에 최적화하기 위해.
- 모델 정확도를 유지하면서도 훈련 처리량을 크게 향상시키는 분산 학습 파이프라인을 설계하기 위해.
실험 결과
연구 질문
- RQ1수백 개의 CPU 노드를 통해 전체 배치 GNN 학습을 어떻게 효율적으로 확장할 수 있는가?
- RQ2분산 GNN 학습에서 통신량을 최소화하는 그래프 분할 전략은 무엇인가?
- RQ3지연 업데이트를 통한 통신 회피가 훈련 성능 향상에 얼마나 기여하는가?
- RQ4제안된 프레임워크는 기준선 DGL 구현 대비 속도 향상과 확장성 측면에서 어떻게 비교되는가?
주요 결과
- 단일 CPU 소켓을 사용할 경우 DistGNN는 기준선 DGL 대비 최대 3.7배의 속도 향상을 달성한다.
- 128개 CPU 소켓을 사용할 경우 DistGNN는 단일 소켓 기준선 DGL 학습 대비 최대 97배의 속도 향상을 제공한다.
- 최소 정점 컷 그래프 분할 알고리즘이 분산 GNN 학습에서 노드 간 통신량을 효과적으로 줄인다.
- 지연 업데이트를 통한 통신 회피 기법이 노드 간 통신 오버헤드를 크게 감소시킨다.
- 모델 성능을 유지하면서도 대규모 그래프에서 확장 가능한 전체 배치 학습을 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.