Skip to main content
QUICK REVIEW

[논문 리뷰] Legion: Automatically Pushing the Envelope of Multi-GPU System for Billion-Scale GNN Training

Jie Sun, Li Su|arXiv (Cornell University)|2023. 05. 26.
Caching and Content Delivery인용 수 5
한 줄 요약

Legion은 빌리언 스케일 그래프 신경망 훈련을 위한 멀티-GPU GNN 훈련 시스템으로, 자동으로 캐시 사용을 최적화합니다. NVLink 인식 히에라르키컬 분할과 핫니스 인식 통합 캐시를 사용하여 PCIe 트래픽을 최소화하고 처리량을 극대화하여, 대규모 그래프에서 최신 기술 대비 최대 4.32배의 성능 향상을 달성합니다.

ABSTRACT

Graph neural network(GNN) has been widely applied in real-world applications, such as product recommendation in e-commerce platforms and risk control in financial management systems. Several cache-based GNN systems have been built to accelerate GNN training in a single machine with multiple GPUs. However, these systems fail to train billion-scale graphs efficiently, which is a common challenge in the industry. In this work, we propose Legion, a system that automatically pushes the envelope of multi-GPU systems for accelerating billion-scale GNN training. First, we design a hierarchical graph partitioning mechanism that significantly improves the multi-GPU cache performance. Second, we build a unified multi-GPU cache that helps to minimize the PCIe traffic incurred by caching both graph topology and features with the highest hotness. Third, we develop an automatic caching management mechanism that adapts the multi-GPU cache plan according to the hardware specifications and various graphs to maximize the overall training throughput. Evaluations on various GNN models and multiple datasets show that Legion supports training billion-scale GNNs in a single machine and significantly outperforms the state-of-the-art cache-based systems on small graphs.

연구 동기 및 목표

  • 기존 캐시 기반 GNN 시스템의 다중 GPU 환경에서의 낮은 확장성, 특히 빌리언 스케일 그래프에서의 문제를 해결합니다.
  • 기존 시스템에서의 캐시 복제 및 굵은 토폴로지 관리의 한계를 극복합니다.
  • 접근 빈도에 기반한 핫니스를 고려해 그래프 토폴로지와 특징을 지능적으로 캐시하여 PCIe 데이터 전송을 최소화합니다.
  • 사용자 조정 없이 다양한 하드웨어 구성과 그래프 워크로드에 적응할 수 있도록 캐시 관리를 자동화합니다.
  • 빌리언 스케일 그래프에 대해 단일 머신 다중 GPU 시스템에서 효율적이고 종단 간 GNN 훈련을 가능하게 합니다.

제안 방법

  • NVLink 인식 히에라르키컬 그래프 분할 기법 제안: 먼저 엣지 컷을 최소화하여 NVLink 클러스터에 독립적인 분할을 할당하고, 이후 각 클러스터 내에서 해시 분할을 사용해 훈련 대상 정점들을 개별 GPU에 매핑합니다.
  • 정점 중심 데이터 구조를 사용해 특징과 토폴로지를 모두 저장하는 핫니스 인식 통합 캐시 설계로, 접근 빈도가 가장 높은 데이터를 우선순위로 지정합니다.
  • NVLink 클러스터 내 GPU 간 캐시 공유를 지원하여 메모리 활용도를 향상시키고 중복 데이터 저장을 줄입니다.
  • 하드웨어 사양과 그래프 특성에 기반해 동적으로 캐시 할당을 계획하는 자동 캐시 관리 메커니즘을 구현합니다.
  • 예비 샘플링 단계에서 접근 빈도를 기반으로 한 핫니스 지표를 사용해 캐시 배치를 안내하고 캐시 미스를 최소화합니다.
  • 통합 캐싱과 GPU 기반 그래프 샘플링을 통합하여 샘플링 및 특징 추출 단계를 모두 가속화합니다.
Figure 1: The workflow of 2-hop GraphSAGE training.
Figure 1: The workflow of 2-hop GraphSAGE training.

실험 결과

연구 질문

  • RQ1과도한 데이터 복제 없이 빌리언 스케일 GNN 훈련을 위한 다중 GPU 캐시 확장성을 어떻게 향상시킬 수 있을까요?
  • RQ2다수의 GPU에 걸쳐 토폴로지와 특징 캐시를 통합적이고 GPU 효율적으로 관리하는 최적의 방법은 무엇일까요?
  • RQ3하드웨어나 그래프 특성에 대한 사전 지식 없이도 사용자 조정 없이 최적의 캐시 계획을 자동 생성할 수 있을까요?
  • RQ4NVLink 토폴로지 기반 히에라르키컬 분할이 캐시 성능 향상과 PCIe 대역폭 압박 감소에 어떻게 기여할까요?
  • RQ5기존 시스템 대비 통합형 핫니스 인식 캐싱이 대규모 그래프에서 훈련 처리량 향상에 얼마나 기여할 수 있을까요?

주요 결과

  • Legion은 단일 다중 GPU 머신에서 빌리언 스케일 그래프의 종단 간 훈련을 지원하여 이전 시스템의 확장성 한계를 초월합니다.
  • 소형 및 중형 그래프에서 최신 기술 대비 최대 4.32배의 성능 향상을 달성하여 뛰어난 처리량을 입증합니다.
  • 최소한의 캐시 비율로도 높은 캐시 히트율(그림 9 및 11 참조)을 유지하여 캐시 활용 효율성이 뛰어나다는 것을 보여줍니다.
  • 히에라르키컬 분할은 캐시 복제를 줄이고 파artition 내 데이터 국지성을 유지하여 전반적인 메모리 효율성을 향상시킵니다.
  • 자동 캐시 관리 메커니즘은 사용자 제공 설정 조정이 필요 없으며 다양한 하드웨어 및 그래프 워크로드에 효과적으로 적응합니다.
  • 통합 캐시 설계로 접근 빈도가 높은 정점에 우선순위를 두어 PCIe 트래픽을 감소시켜 데이터 전송 오버헤드를 크게 낮춥니다.
(a) 2 GPUs per NVLink clique
(a) 2 GPUs per NVLink clique

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.