Skip to main content
QUICK REVIEW

[논문 리뷰] GraphTheta: A Distributed Graph Neural Network Learning System With Flexible Training Strategy

Yongchao Liu, Houyi Li|arXiv (Cornell University)|2021. 04. 21.
Advanced Graph Neural Networks참고 문헌 35인용 수 5
한 줄 요약

GraphTheta는 사용자 정의 신경망 연산자와 함께 정점 중심의 그래프 처리를 활용하여 대규모 그래프에서 확장성 있고 유연한 학습을 가능하게 하는 분산 그래프 신경망(GNN) 학습 시스템이다. 이 시스템은 NN-TGAR 추상화와 하이브리드 병렬 실행을 도입하여 클러스터-배치 학습을 포함한 다양한 학습 전략을 지원하며, CPU 기반 가상 머신을 사용하여 14억 개 노드와 41억 개 간선을 가진 산업 규모의 데이터셋에서 GraphLearn 대비 최대 30.56배, DistDGL 대비 2.02배 빠른 성능을 달성한다.

ABSTRACT

Graph neural networks (GNNs) have been demonstrated as a powerful tool for analyzing non-Euclidean graph data. However, the lack of efficient distributed graph learning systems severely hinders applications of GNNs, especially when graphs are big and GNNs are relatively deep. Herein, we present GraphTheta, the first distributed and scalable graph learning system built upon vertex-centric distributed graph processing with neural network operators implemented as user-defined functions. This system supports multiple training strategies and enables efficient and scalable big-graph learning on distributed (virtual) machines with low memory. To facilitate graph convolutions, GraphTheta puts forward a new graph learning abstraction named NN-TGAR to bridge the gap between graph processing and graph deep learning. A distributed graph engine is proposed to conduct the stochastic gradient descent optimization with a hybrid-parallel execution, and a new cluster-batched training strategy is supported. We evaluate GraphTheta using several datasets with network sizes ranging from small-, modest- to large-scale. Experimental results show that GraphTheta can scale well to 1,024 workers for training an in-house developed GNN on an industry-scale Alipay dataset of 1.4 billion nodes and 4.1 billion attributed edges, with a cluster of CPU virtual machines (dockers) of small memory each (5$\sim$12GB). Moreover, GraphTheta can outperform DistDGL by up to $2.02 imes$, with better scalability, and GraphLearn by up to $30.56 imes$. As for model accuracy, GraphTheta is capable of learning as good GNNs as existing frameworks. To the best of our knowledge, this work presents the largest edge-attributed GNN learning task in the literature.

연구 동기 및 목표

  • 높은 차수의 노드를 가진 대규모, 깊이 있는, 또는 극도로 비균형적인 그래프에서 기존 GNN 프레임워크의 확장성 한계를 해결한다.
  • 미니배치 전략에서 발생하는 하위그래프 폭발로 인한 분산 GNN 학습의 메모리 및 성능 병목 현상을 해결한다.
  • 통합적이고 확장 가능한 시스템 아키텍처 내에서 클러스터-배치를 포함한 다양한 학습 전략을 유연하게 지원한다.
  • GPU나 전용 하드웨어 없이도 일반 CPU 클러스터에서 효율적이고 저메모리 GNN 학습을 지원한다.
  • 분산 환경에서 전통적인 그래프 처리와 딥러닝 워크로드 간의 의미적 및 아키텍처적 격차를 메운다.

제안 방법

  • 그래프 계산을 딥러닝 프레임워크에서 분리하기 위해, 정점 중심의 분산 그래프 처리 엔진 내에서 사용자 정의 함수(UDF)로 GNN을 구현한다.
  • 재귀를 위한 신경망 전용 그래프 추상화(NN-TGAR)를 도입하여 그래프 처리와 GNN 연산을 통합하고, 그래프 컨볼루션의 구현을 단순화한다.
  • 하이브리드 병렬 실행을 적용: 각 학습 배치는 분산 방식으로 일괄 처리되는 워커 그룹에 의해 처리되며, 데이터 병렬성과 모델 병렬성을 동적으로 조합한다.
  • 클러스터-배치 학습 전략을 설계하여, 여러 노드에 걸쳐 하위그래프를 조율적으로 처리함으로써 메모리 압박을 줄이고 수렴성을 향상시킨다.
  • 스토캐스틱 그래디언트 디센트(SGD)를 최적화하기 위해, 효율적인 이웃 샘플링과 워커 간 그래디언트 집계를 지원하는 분산 그래프 엔진을 활용한다.
  • 새로운 학습 전략과 그래프 처리 원자를 쉽게 통합할 수 있도록 모듈식이고 확장 가능한 시스템 아키텍처를 설계한다.

실험 결과

연구 질문

  • RQ1정점 중심의 그래프 처리 모델 기반의 분산 GNN 학습 시스템이, 노드당 제한된 메모리로도 산업 규모의 그래프에서 높은 확장성과 성능을 달성할 수 있는가?
  • RQ2제안된 NN-TGAR 추상화가 기존 프레임워크에 비해 그래프 컨볼루션의 표현력과 효율성에 어떤 영향을 미치는가?
  • RQ3GraphTheta의 성능와 확장성은 대규모이고 간선 속성이 있는 그래프에서 다양한 학습 전략, 특히 클러스터-배치 전략에 대해 어떻게 나타나는가?
  • RQ4실제 워크로드에서 DistDGL 및 GraphLearn와 같은 기존 분산 GNN 프레임워크에 비해 GraphTheta가 학습 속도와 모델 일반화 능력에서 뛰어난 성능을 보일 수 있는가?
  • RQ5GPU 가속 없이도 CPU 기반 시스템이 대규모 GNN 학습에서 경쟁적인 성능을 달성할 수 있는 정도는 어느 정도인가?

주요 결과

  • GraphTheta는 CPU 기반 가상 머신 클러스터에서 최대 1,024개의 워커로 효과적으로 확장되어 대규모 GNN 학습에 대한 강력한 수평 확장성을 입증했다.
  • Alipay 데이터셋(14억 노드, 41억 간선)에서 4층 GCN을 학습할 경우 GraphTheta는 GraphLearn 대비 30.56배 빠르고 DistDGL 대비 2.02배 빠른 성능을 기록했다.
  • 클러스터-배치 학습 전략은 Alipay 데이터셋에서 가장 빠른 수렴성과 가장 우수한 일반화 성능를 보였으며, 표준 미니배치 및 글로벌배치 전략을 모두 능가했다.
  • Reddit와 같은 여러 벤치마크 데이터셋에서 GraphTheta는 DistDGL 및 GraphLearn와 같은 기존 프레임워크와 비교해 유사하거나 더 높은 모델 정확도를 달성했다.
  • 노드가 수십만 개의 이웃을 가진 극도로 비균형적인 그래프에서도 시스템은 효율적인 배치 관리로 하위그래프 폭발을 방지하며 견고한 성능을 보였다.
  • GPU 없이도 CPU에서만 실행됨에도 불구하고 GraphTheta는 경쟁적인 학습 처리량을 기록하여, 공용 클라우드 인프라에서 저비용으로 생산 환경에 구현 가능한 잠재력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.