Skip to main content
QUICK REVIEW

[논문 리뷰] PipeGCN: Efficient Full-Graph Training of Graph Convolutional Networks with Pipelined Feature Communication

Cheng Wan, Youjie Li|arXiv (Cornell University)|2022. 03. 20.
Advanced Graph Neural Networks인용 수 4
한 줄 요약

PipeGCN는 분산 그래프 컨volution 네트워크(GCN) 학습에서 파artition 간 통신 오버헤드를 숨기기 위해 파이프라인 통신-계산 기반 방식을 제안한다. 이는 효율적인 전체 그래프 학습을 가능하게 하며, 특성 및 기울기의 오래된 상태에도 불구하고 거의 원본 모델 수렴 속도를 유지한다. 다양한 데이터셋과 GPU 구성에서 1.7배에서 28.5배의 처리량 향상을 기록했으며, 정확도는 일관되게 유지된다.

ABSTRACT

Graph Convolutional Networks (GCNs) is the state-of-the-art method for learning graph-structured data, and training large-scale GCNs requires distributed training across multiple accelerators such that each accelerator is able to hold a partitioned subgraph. However, distributed GCN training incurs prohibitive overhead of communicating node features and feature gradients among partitions for every GCN layer during each training iteration, limiting the achievable training efficiency and model scalability. To this end, we propose PipeGCN, a simple yet effective scheme that hides the communication overhead by pipelining inter-partition communication with intra-partition computation. It is non-trivial to pipeline for efficient GCN training, as communicated node features/gradients will become stale and thus can harm the convergence, negating the pipeline benefit. Notably, little is known regarding the convergence rate of GCN training with both stale features and stale feature gradients. This work not only provides a theoretical convergence analysis but also finds the convergence rate of PipeGCN to be close to that of the vanilla distributed GCN training without any staleness. Furthermore, we develop a smoothing method to further improve PipeGCN's convergence. Extensive experiments show that PipeGCN can largely boost the training throughput (1.7x~28.5x) while achieving the same accuracy as its vanilla counterpart and existing full-graph training methods. The code is available at https://github.com/RICE-EIC/PipeGCN.

연구 동기 및 목표

  • 다양한 가속기에서 분산 GCN 학습의 높은 통신 오버헤드와 동기화 비용을 해결하기 위해.
  • 통신 병목 현상을 최소화하여 모델 정확도를 희생시키지 않고 효율적인 전체 그래프 학습을 가능하게 하기 위해.
  • 파이프라인 학습에서 특성 및 기울기의 오래됨으로 인한 수렴 저하를 이론적으로 분석하고 완화하기 위해.
  • 오래됨 현상이 존재하는 상황에서 수렴 안정성을 향상시키기 위한 실용적이고 저비용의 스무딩 방법을 개발하기 위해.
  • 기본 분산 GCN 및 최신 전체 그래프 학습 방법 대비 뚜렷한 처리량 향상을 입증하기 위해.

제안 방법

  • GCN 레이어 간 통신 지연을 숨기기 위해 파artition 간 통신과 파artition 내 계산을 파이프라인화하기.
  • 효율성을 높이기 위해 모든 통신 작업을 배치하고, 두 번째 CUDA 스트림을 사용해 통신를 계산과 겹치기.
  • 특성 및 기울기 오래됨으로 인한 오차를 줄이기 위해 스무딩 방법을 도입하여 수렴 안정성 향상.
  • 역전파 과정에서 노이즈를 방지하고 기울기 일관성을 유지하기 위해 통신 후 드롭아웃 적용.
  • 파이프라인 환경에서 순방향 및 역방향 전파 간에 일관된 드롭아웃 마스크 유지로 모델 정확도 유지를 위한 조치.
  • 10Gbps 이더넷을 사용한 다수의 GPU 서버에 걸쳐 확장 가능하게 설계하여, 다양한 파artition 방식과 하드웨어 구성에서도 견고함을 입증함.

실험 결과

연구 질문

  • RQ1파artition 간 통신을 파이프라인화하고 파artition 내 계산을 병행함으로써 분산 GCN 학습에서 학습 시간을 크게 단축시킬 수 있으며, 이로 인해 모델 정확도가 떨어지지 않을까?
  • RQ2파이프라인으로 인해 특성과 특성 기울기가 모두 오래되었을 경우 GCN 학습의 이론적 수렴 속도는 어떻게 되는가?
  • RQ3제안된 스무딩 방법은 특성 및 기울기 통신에서 오래됨으로 인해 발생하는 오차를 어떻게 줄이는가?
  • RQ4다양한 데이터셋과 하드웨어 환경에서 PipeGCN는 기본 분산 GCN 및 기존 전체 그래프 학습 방법 대비 처리량과 정확도에서 어떻게 비교되는가?
  • RQ5이질적인 파artition 방식과 네트워크 제약 조건이 존재하는 다수의 GPU 서버로 확장할 경우 PipeGCN는 높은 학습 효율성과 정확도를 유지할 수 있는가?

주요 결과

  • PipeGCN는 기본 분산 GCN 학습 대비 1.7배에서 28.5배의 학습 처리량 향상을 기록했으며, 평가된 모든 데이터셋에서 일관된 정확도를 유지한다.
  • PipeGCN의 이론적 수렴 속도는 O(T^(-2/3))이며, 오래됨이 없는 기본 분산 GCN 학습의 O(T^(-1))에 매우 가까운 수준이다.
  • 제안된 스무딩 방법은 오래됨으로 인한 오차를 추가로 줄여주며, 높은 처리량에서 안정적인 학습을 가능하게 한다.
  • Reddit 데이터셋에서 PipeGCN는 2~16개 GPU 파artition에서 97.0%에서 97.14%의 정확도를 유지했으며, 작은 설정에서는 1.16배에서 1.65배의 속도 향상을 기록했고, 3×4 GPU 구성에서는 최대 1.65배의 속도 향상을 기록했다.
  • 다수의 GPU 서버로 확장해도 정확도를 유지하면서 파artition 방식이나 하드웨어 구성에 관계없이 15%에서 66%의 속도 향상을 기록했다.
  • 실험 결과 PipeGCN 변종(PipeGCN-GF 등)은 원본 학습과 유사한 수렴 속도를 보였지만, 벽시계 시간은 반으로 줄여 파이프라인화와 스무딩의 효과를 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.