Skip to main content
QUICK REVIEW

[논문 리뷰] A Comprehensive Survey on Distributed Training of Graph Neural Networks

Haiyang Lin, Mingyu Yan|arXiv (Cornell University)|2022. 11. 10.
Advanced Graph Neural Networks인용 수 4
한 줄 요약

이 논문은 그래프 신경망(GNN)을 위한 분산 학습에 대한 종합적인 설문 조사로, 워크플로우, 계산 및 통신 패턴, 최적화 기법을 분류한다. 과도한 스무딩과 통신 오버헤드와 같은 주요 과제를 부각시키며, 대규모 그래프 학습을 위한 깊은 GNN 아키텍처와 모델 병렬성의 잠재적 기회를 규명한다.

ABSTRACT

Graph neural networks (GNNs) have been demonstrated to be a powerful algorithmic model in broad application fields for their effectiveness in learning over graphs. To scale GNN training up for large-scale and ever-growing graphs, the most promising solution is distributed training which distributes the workload of training across multiple computing nodes. At present, the volume of related research on distributed GNN training is exceptionally vast, accompanied by an extraordinarily rapid pace of publication. Moreover, the approaches reported in these studies exhibit significant divergence. This situation poses a considerable challenge for newcomers, hindering their ability to grasp a comprehensive understanding of the workflows, computational patterns, communication strategies, and optimization techniques employed in distributed GNN training. As a result, there is a pressing need for a survey to provide correct recognition, analysis, and comparisons in this field. In this paper, we provide a comprehensive survey of distributed GNN training by investigating various optimization techniques used in distributed GNN training. First, distributed GNN training is classified into several categories according to their workflows. In addition, their computational patterns and communication patterns, as well as the optimization techniques proposed by recent work are introduced. Second, the software frameworks and hardware platforms of distributed GNN training are also introduced for a deeper understanding. Third, distributed GNN training is compared with distributed training of deep neural networks, emphasizing the uniqueness of distributed GNN training. Finally, interesting issues and opportunities in this field are discussed.

연구 동기 및 목표

  • 분산 GNN 학습 연구의 점점 증가하는 복잡성과 분열을 다루기 위해, 초보자들이 워크플로우, 패턴, 최적화 전략을 이해하는 데 어려움을 겪지 않도록 한다.
  • 실행 워크플로우 기반으로 분산 GNN 학습 방법을 체계적으로 분류하며, 전체 배치 및 미니배치 학습 파라다임을 포함한다.
  • 다양한 분산 학습 접근 방식 간의 계산 및 통신 패턴을 분석하여, 메모리 및 통신 오버헤드와 같은 성능 저하 요인을 강조한다.
  • 분산 DNN 학습과의 대비를 통해, 그래프 구조와 메시지 전달 방식으로 인해 발생하는 고유한 과제를 부각시킨다.
  • 열려 있는 문제점과 향후 연구 기회를 규명하며, 특히 깊은 GNN 아키텍처와 확장 가능한 모델 병렬성의 실현 가능성을 중심으로 한다.

제안 방법

  • 논문은 분산 GNN 학습을 디스패치 워크로드 기반 및 프리셋 워크로드 기반의 전체 배치 학습, 개별 샘플 기반 및 공동 샘플 기반의 미니배치 학습으로 분류한다.
  • GNN 내의 집계 및 조합 연산과 같은 계산 패턴과, 노드 간의 특성 및 기울기 교환을 포함한 통신 패턴을 분석한다.
  • 통신 및 메모리 비용을 줄이기 위한 최적화 기법으로 활성화 재생산, 미니배치 파이프라인, 데이터 캐싱을 검토한다.
  • 분산 GNN 학습에 사용된 소프트웨어 프레임워크와 하드웨어 플랫폼을 평가하여 시스템 효율성에 미치는 영향을 분석한다.
  • 그래프 특화의 데이터 의존성과 비유클리드 구조로 인한 차이점을 강조하며, 분산 DNN 학습과의 비교를 수행한다.
  • 성능 저하 문제를 극복하기 위한 새로운 추세로, 더 깊은 GNN 모델과 파이프라인 및 모델 병렬성의 잠재력을 논의한다.

실험 결과

연구 질문

  • RQ1분산 GNN 학습은 워크플로우 및 실행 모델 기반으로 어떻게 체계적으로 분류될 수 있는가?
  • RQ2분산 GNN 학습에서 지배적인 계산 및 통신 패턴은 무엇이며, 분산 DNN 학습과의 차이는 무엇인가?
  • RQ3분산 GNN 학습에서 통신 및 메모리 오버헤드를 효과적으로 줄이는 최적화 기법은 무엇인가?
  • RQ4과도한 스무딩과 미흡한 영향 전파와 같은 성능 저하 문제들이 분산 학습 전략에 어떻게 영향을 미치는가?
  • RQ5대규모 그래프에서 GNN을 확장하기 위해 가장 유망한 향후 연구 방향은 무엇인가?

주요 결과

  • 모델 분할의 어려움에도 불구하고, DNN의 데이터 병렬성과 유사성 덕분에 분산 미니배치 학습이 현재 주로 사용되고 있다.
  • GNN에서의 성능 저하, 특히 과도한 스무딩과 장거리 의존성 미흡 현상으로 인해 모델 깊이가 제한되며, 일반적으로 2~4층으로 제한된다.
  • DropEdge와 DropNode와 같은 기법은 과도한 스무딩을 완화하며, 가상 엣지와 슈퍼 버텍스는 장거리 의존성 문제를 해결하는 데 기여한다.
  • 통신 및 메모리 오버헤드는 여전히 주요 병목 현상이며, 활성화 재생산, 파이프라인 전송, 데이터 캐싱과 같은 연구를 촉진하고 있다.
  • 더 깊은 GNN 모델의 부상은 모델 병렬성과 파이프라인 병렬성의 우선시를 이끌 것이며, 최적화의 초점이 데이터 분할에서 모델 분할로 이동할 전망이다.
  • 빠른 진전에도 불구하고, 대규모 그래프에서 확장 가능하고 효율적이며 일반화 가능한 분산 학습 프레임워크에 대한 심각한 연구 격차가 남아 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.